Как работает распознавание речи

Что происходит между звуковой волной и готовым текстом — без формул и без обещаний волшебства.

Открыть в Telegram Все статьи Оплата картой, от 1,63 ₽ за минуту

Сначала находят речь

Первым делом запись просматривают на предмет того, где вообще говорят. Музыка, шум, тишина и аплодисменты отбрасываются: распознавать их бессмысленно, а время они съедят.

Именно на этом шаге музыкальный ролик может дать ноль результата — речи в нём нет, отбрасывается всё.

Потом звук превращают в признаки

Звуковая волна разбивается на короткие кусочки, и для каждого считается набор чисел, описывающих его звучание. Дальше модель работает не со звуком, а с этими числами.

Поэтому качество записи важнее формата файла: если в исходном звуке согласные размыты эхом, восстановить их уже нечем.

Затем выбирают слова

Модель предсказывает наиболее вероятную последовательность слов. Слово выбирается не только по звучанию, но и по тому, что было сказано до него.

Отсюда характерные ошибки: редкое имя собственное заменяется похожим по звучанию обычным словом, потому что обычное встречается чаще.

И расставляют знаки

Пунктуация и заглавные буквы добавляются отдельным шагом: в звуке их нет. Поэтому в длинных сложных предложениях запятые иногда стоят не там.

Разделение по говорящим — тоже отдельная задача. Она сравнивает голоса между собой и группирует отрезки, а не узнаёт людей по именам.

Первая запись — прямо сейчас

Откройте бота, пришлите файл или ссылку и посмотрите, что получится.

Открыть в Telegram