Сначала находят речь
Первым делом запись просматривают на предмет того, где вообще говорят. Музыка, шум, тишина и аплодисменты отбрасываются: распознавать их бессмысленно, а время они съедят.
Именно на этом шаге музыкальный ролик может дать ноль результата — речи в нём нет, отбрасывается всё.
Потом звук превращают в признаки
Звуковая волна разбивается на короткие кусочки, и для каждого считается набор чисел, описывающих его звучание. Дальше модель работает не со звуком, а с этими числами.
Поэтому качество записи важнее формата файла: если в исходном звуке согласные размыты эхом, восстановить их уже нечем.
Затем выбирают слова
Модель предсказывает наиболее вероятную последовательность слов. Слово выбирается не только по звучанию, но и по тому, что было сказано до него.
Отсюда характерные ошибки: редкое имя собственное заменяется похожим по звучанию обычным словом, потому что обычное встречается чаще.
И расставляют знаки
Пунктуация и заглавные буквы добавляются отдельным шагом: в звуке их нет. Поэтому в длинных сложных предложениях запятые иногда стоят не там.
Разделение по говорящим — тоже отдельная задача. Она сравнивает голоса между собой и группирует отрезки, а не узнаёт людей по именам.