Две разные задачи
Распознавание речи отвечает на вопрос «что сказано». Диаризация — на вопрос «кто и когда говорил». Это разные модели, работающие независимо, а результат потом склеивается по времени.
Отсюда следствие, которое удивляет: текст может быть точным, а подписи участников перепутанными. И наоборот — участники разделены верно, а слова разобраны плохо.
Как это устроено
Запись режется на короткие отрезки. Для каждого считается числовой отпечаток голоса — набор чисел, описывающих тембр, а не слова.
Дальше отпечатки сравниваются между собой и группируются: похожие — один человек, непохожие — разные. Именно поэтому машина не знает имён: она видит, что голосов три, но кто из них Марина, ей неизвестно.
Имена подставляются вами один раз, после чего «Спикер 1» превращается в человека во всём тексте.
Где она ошибается
- Одновременная речь: чистого куска голоса, по которому можно отличить одного от другого, просто не остаётся.
- Один дальний микрофон на всех: тембры смазываются, и похожие голоса сливаются в один.
- Очень короткие реплики: на «да» и «угу» отпечаток посчитать почти не по чему.
- Много участников: чем больше голосов, тем выше вероятность спутать двух похожих.
Когда её не стоит заказывать
Если на записи говорит один человек — лекция, надиктовка, монолог. Разделение добавит половину к списанию и не даст ничего: спикер и так один.
Если запись сделана в шумном месте с одного дальнего микрофона, стоит трезво ждать ошибок в подписях.