Как машина понимает, кто говорит

Разделение по говорящим — отдельная задача, и решается она не так, как распознавание слов.

Открыть в Telegram Все статьи Оплата картой, от 1,63 ₽ за минуту

Две разные задачи

Распознавание речи отвечает на вопрос «что сказано». Диаризация — на вопрос «кто и когда говорил». Это разные модели, работающие независимо, а результат потом склеивается по времени.

Отсюда следствие, которое удивляет: текст может быть точным, а подписи участников перепутанными. И наоборот — участники разделены верно, а слова разобраны плохо.

Как это устроено

Запись режется на короткие отрезки. Для каждого считается числовой отпечаток голоса — набор чисел, описывающих тембр, а не слова.

Дальше отпечатки сравниваются между собой и группируются: похожие — один человек, непохожие — разные. Именно поэтому машина не знает имён: она видит, что голосов три, но кто из них Марина, ей неизвестно.

Имена подставляются вами один раз, после чего «Спикер 1» превращается в человека во всём тексте.

Где она ошибается

  • Одновременная речь: чистого куска голоса, по которому можно отличить одного от другого, просто не остаётся.
  • Один дальний микрофон на всех: тембры смазываются, и похожие голоса сливаются в один.
  • Очень короткие реплики: на «да» и «угу» отпечаток посчитать почти не по чему.
  • Много участников: чем больше голосов, тем выше вероятность спутать двух похожих.

Когда её не стоит заказывать

Если на записи говорит один человек — лекция, надиктовка, монолог. Разделение добавит половину к списанию и не даст ничего: спикер и так один.

Если запись сделана в шумном месте с одного дальнего микрофона, стоит трезво ждать ошибок в подписях.

Первая запись — прямо сейчас

Откройте бота, пришлите файл или ссылку и посмотрите, что получится.

Открыть в Telegram