Speech to text: как машина превращает речь в текст

Speech to text (STT, ASR) — технология, превращающая звучащую речь в текстовую строку. Разбираем, что происходит внутри между микрофоном и готовым текстом, почему на одной записи точность близка к идеальной, а на другой рушится, какие модели применяют сегодня и какие данные нужны, чтобы обучить систему распознавания под свою задачу.

Автор: Редакция DataMarkupОпубликовано: 2026-07-27
Speech to text: как машина превращает речь в текст — иллюстрация к статье

Что такое speech to text?

Speech to text — технология, которая принимает на вход звуковой сигнал с речью и возвращает соответствующий ему текст. В инженерной литературе её называют ASR, автоматическим распознаванием речи. Именно она стоит за голосовым вводом в телефоне, автоматическими субтитрами в видеосервисах и расшифровкой звонков в контакт-центрах.

Задача выглядит простой только снаружи. Человек произносит слова слитно, с разной скоростью, проглатывает окончания, перебивает собеседника и говорит на фоне шума. Система должна из непрерывной звуковой волны восстановить дискретную последовательность слов — и сделать это без опоры на то, о чём вообще идёт разговор.

Как устроено распознавание речи внутри?

Современная система проходит три стадии: звук превращается в компактное числовое представление, нейросеть-энкодер извлекает из него признаки речи, а декодер порождает последовательность символов или слов. Языковая часть модели дополнительно оценивает, насколько получившийся текст правдоподобен, и выбирает наиболее вероятный вариант расшифровки.

Ранние системы собирали эти части по отдельности и требовали произносительных словарей. Современные модели вроде Whisper обучаются end-to-end: одна нейросеть напрямую отображает звук в текст, а разметка пунктуации и определение языка встроены в тот же процесс.

Почему точность так сильно различается?

Качество распознавания определяется в первую очередь условиями записи, а не выбором модели. Расстояние до микрофона, реверберация в комнате, наложение голосов, темп речи, акцент и доля специальной терминологии влияют на результат сильнее, чем разница между двумя современными моделями. Именно поэтому демонстрации на подготовленных записях всегда выглядят убедительнее реального внедрения.

Наиболее частые источники ошибок:

  1. Имена собственные и термины. Фамилии, названия компаний, препаратов и деталей модель никогда не видела в обучении и заменяет созвучными словами.
  2. Перекрывающаяся речь. Когда двое говорят одновременно, система склеивает реплики в один поток.
  3. Дальний микрофон. Запись совещания с одного устройства в центре стола даёт разную громкость участников.
  4. Числа и форматы. Даты, суммы и артикулы распознаются верно по звучанию, но записываются в неожиданном формате.
  5. Спонтанная речь. Самоперебивания, паузы, слова-паразиты ломают ожидаемую структуру предложения.

Как измеряют качество распознавания?

Основная метрика — WER, доля ошибочных слов относительно эталонной расшифровки. Она считается как сумма замен, пропусков и вставок, делённая на число слов эталона. Для оценки нужен размеченный человеком контрольный набор записей: без него любые заявления о точности остаются непроверяемыми, поскольку сравнивать распознанный текст не с чем.

Важная деталь: WER считает все ошибки одинаковыми, хотя для бизнеса они неравноценны. Пропущенное слово-паразит и неверно распознанная сумма договора одинаково прибавляют к метрике, но означают совершенно разное. Поэтому в прикладных проектах рядом с WER смотрят на ошибки в ключевых сущностях — числах, именах, терминах.

Когда нужна своя модель, а когда хватит готовой?

Готовой модели достаточно, если речь обычная, условия записи приличные, а отдельные ошибки не критичны: конспекты встреч, поиск по видеоархиву, черновая расшифровка. Собственное дообучение оправдано, когда в записях много доменной терминологии, требуется работа в закрытом контуре без передачи данных наружу или заявленный уровень точности нужно закрепить документально.

Дообучение требует размеченных данных: записей с выверенной под звук расшифровкой, а часто ещё и с разметкой говорящих и временных меток. Такой набор собирают под конкретный домен — общий корпус не поможет модели распознать номенклатуру вашего склада. Как устроена подготовка речевых датасетов, разобрано на странице разметки аудио; практическая сторона расшифровки отдельных записей — в гайде как расшифровать аудио в текст.

Частые вопросы

Speech to text и ASR — это одно и то же?

По сути да. ASR (automatic speech recognition) — принятый в инженерной среде термин, speech to text или STT — его бытовой эквивалент. Оба обозначают автоматический перевод звучащей речи в текст, без участия человека.

Какая точность у современных систем распознавания?

На чистой студийной записи одного говорящего современные модели ошибаются в единицах процентов слов. На реальной записи с шумом, несколькими говорящими и профессиональной терминологией доля ошибок вырастает в несколько раз, поэтому заявленные в рекламе цифры почти всегда относятся к лабораторным условиям.

Что такое WER?

WER (word error rate) — доля ошибочных слов относительно эталонного текста: сумма замен, пропусков и лишних слов, делённая на число слов эталона. WER 10% означает, что каждое десятое слово распознано неверно. Это основная метрика качества систем распознавания речи.

Можно ли обучить распознавание под свою терминологию?

Да, для этого модель дообучают на размеченных записях из вашей предметной области или подключают словарь терминов и имён. Наибольший прирост даёт именно доменная лексика: названия препаратов, деталей, продуктов, которых не было в общем обучающем корпусе.

Сколько данных нужно для дообучения ASR?

Ориентир для заметного прироста в узком домене — десятки часов размеченной речи, где текст выверен под звук. Важнее объёма разнообразие: разные говорящие, акценты, условия записи и микрофоны, иначе модель хорошо работает только на записях, похожих на обучающие.

Нужна такая задача на практике?

Опишите, что у вас за данные и какая цель — вернёмся с планом, сроком и оценкой в течение рабочего дня.

Не любите формы — напишите на info@datamarkup.ru

Смотрите также

Telegramответим за 15 минут