Что такое speech to text?
Speech to text — технология, которая принимает на вход звуковой сигнал с речью и возвращает соответствующий ему текст. В инженерной литературе её называют ASR, автоматическим распознаванием речи. Именно она стоит за голосовым вводом в телефоне, автоматическими субтитрами в видеосервисах и расшифровкой звонков в контакт-центрах.
Задача выглядит простой только снаружи. Человек произносит слова слитно, с разной скоростью, проглатывает окончания, перебивает собеседника и говорит на фоне шума. Система должна из непрерывной звуковой волны восстановить дискретную последовательность слов — и сделать это без опоры на то, о чём вообще идёт разговор.
Как устроено распознавание речи внутри?
Современная система проходит три стадии: звук превращается в компактное числовое представление, нейросеть-энкодер извлекает из него признаки речи, а декодер порождает последовательность символов или слов. Языковая часть модели дополнительно оценивает, насколько получившийся текст правдоподобен, и выбирает наиболее вероятный вариант расшифровки.
- Предобработка. Аудио режется на короткие окна и переводится в спектральное представление — по сути картину распределения частот во времени.
- Акустическая модель. Нейросеть сопоставляет фрагментам звука вероятности звуковых единиц.
- Декодирование. Из этих вероятностей собирается наиболее правдоподобная цепочка слов.
- Языковая модель. Помогает выбрать между созвучными вариантами: «предел» или «придел», «компания» или «кампания».
Ранние системы собирали эти части по отдельности и требовали произносительных словарей. Современные модели вроде Whisper обучаются end-to-end: одна нейросеть напрямую отображает звук в текст, а разметка пунктуации и определение языка встроены в тот же процесс.
Почему точность так сильно различается?
Качество распознавания определяется в первую очередь условиями записи, а не выбором модели. Расстояние до микрофона, реверберация в комнате, наложение голосов, темп речи, акцент и доля специальной терминологии влияют на результат сильнее, чем разница между двумя современными моделями. Именно поэтому демонстрации на подготовленных записях всегда выглядят убедительнее реального внедрения.
Наиболее частые источники ошибок:
- Имена собственные и термины. Фамилии, названия компаний, препаратов и деталей модель никогда не видела в обучении и заменяет созвучными словами.
- Перекрывающаяся речь. Когда двое говорят одновременно, система склеивает реплики в один поток.
- Дальний микрофон. Запись совещания с одного устройства в центре стола даёт разную громкость участников.
- Числа и форматы. Даты, суммы и артикулы распознаются верно по звучанию, но записываются в неожиданном формате.
- Спонтанная речь. Самоперебивания, паузы, слова-паразиты ломают ожидаемую структуру предложения.
Как измеряют качество распознавания?
Основная метрика — WER, доля ошибочных слов относительно эталонной расшифровки. Она считается как сумма замен, пропусков и вставок, делённая на число слов эталона. Для оценки нужен размеченный человеком контрольный набор записей: без него любые заявления о точности остаются непроверяемыми, поскольку сравнивать распознанный текст не с чем.
Важная деталь: WER считает все ошибки одинаковыми, хотя для бизнеса они неравноценны. Пропущенное слово-паразит и неверно распознанная сумма договора одинаково прибавляют к метрике, но означают совершенно разное. Поэтому в прикладных проектах рядом с WER смотрят на ошибки в ключевых сущностях — числах, именах, терминах.
Когда нужна своя модель, а когда хватит готовой?
Готовой модели достаточно, если речь обычная, условия записи приличные, а отдельные ошибки не критичны: конспекты встреч, поиск по видеоархиву, черновая расшифровка. Собственное дообучение оправдано, когда в записях много доменной терминологии, требуется работа в закрытом контуре без передачи данных наружу или заявленный уровень точности нужно закрепить документально.
Дообучение требует размеченных данных: записей с выверенной под звук расшифровкой, а часто ещё и с разметкой говорящих и временных меток. Такой набор собирают под конкретный домен — общий корпус не поможет модели распознать номенклатуру вашего склада. Как устроена подготовка речевых датасетов, разобрано на странице разметки аудио; практическая сторона расшифровки отдельных записей — в гайде как расшифровать аудио в текст.
