Сколько ошибается русское распознавание речи
2398 записей, 3,1 часа аудио, три открытых набора. Замер от 2026-08-25 12:44: методика, правила нормализации и скрипты открыты, цифры можно перепроверить.
Ни один крупный поставщик распознавания на русском не публикует ни точность по срезам речи, ни скорость обработки. Это единственная причина, по которой такая страница вообще нужна.
Подготовленная начитка
Человек читает подготовленный текст в тишине: аудиокниги, начитка, диктофонная запись без помех. Верхняя граница возможного — на живых записях так не бывает.
Russian LibriSpeech · CC BY 4.0
| Модель | Ошибок в словах | Ошибок в буквах | Знаки на месте 0–1, больше — лучше | Быстрее записи | Час записи за |
|---|---|---|---|---|---|
| Модель A быстрее на любом материале | 6,71 % | 1,50 % | 0,75 | ×8,4 | около 7 мин |
| Модель Б сейчас по умолчанию на задачах | 6,91 % | 1,73 % | 0,73 | ×5,6 | около 11 мин |
«Ошибок в словах» и «ошибок в буквах» — доля того, что пришлось бы исправить, меньше лучше. «Знаки на месте» — от нуля до единицы, больше лучше; прочерк значит, что в эталонах этого набора знаков препинания нет и мерить их не на чем.
Живая спонтанная речь
Люди говорят как говорят: обрывы, оговорки, бытовой шум, разное расстояние до микрофона. Это то, с чем сервис имеет дело в работе.
Golos test · SberDevices
| Модель | Ошибок в словах | Ошибок в буквах | Знаки на месте 0–1, больше — лучше | Быстрее записи | Час записи за |
|---|---|---|---|---|---|
| Модель A быстрее на любом материале | 8,76 % | 3,78 % | — | ×5,5 | около 11 мин |
| Модель Б сейчас по умолчанию на задачах | 7,62 % | 3,66 % | — | ×5,0 | около 12 мин |
«Ошибок в словах» и «ошибок в буквах» — доля того, что пришлось бы исправить, меньше лучше. «Знаки на месте» — от нуля до единицы, больше лучше; прочерк значит, что в эталонах этого набора знаков препинания нет и мерить их не на чем.
SOVA RuDevices · CC BY 4.0
| Модель | Ошибок в словах | Ошибок в буквах | Знаки на месте 0–1, больше — лучше | Быстрее записи | Час записи за |
|---|---|---|---|---|---|
| Модель A быстрее на любом материале | 12,81 % | 4,89 % | — | ×6,6 | около 9 мин |
| Модель Б сейчас по умолчанию на задачах | 12,58 % | 5,30 % | — | ×4,9 | около 12 мин |
«Ошибок в словах» и «ошибок в буквах» — доля того, что пришлось бы исправить, меньше лучше. «Знаки на месте» — от нуля до единицы, больше лучше; прочерк значит, что в эталонах этого набора знаков препинания нет и мерить их не на чем.
Что из этого следует
- Разброс по материалу больше, чем разброс между моделями. Между двумя нашими моделями разница в доли процента, а между подготовленной начиткой и живой речью — в два раза. Значит выбирать сервис по одной цифре бессмысленно: спрашивать надо, на чём она получена.
- Модель A не проиграла по точности, хотя вдвое быстрее. На подготовленной начитке она даже чуть впереди; на живой речи впереди модель Б, тоже на доли процента. Мы разбираемся, что из этого следует для настройки по умолчанию — и напишем здесь, когда решим, а не наоборот.
- Ошибок в буквах в два-четыре раза меньше, чем в словах. Это значит, что промахи мелкие: чаще всего задето окончание или одна буква, а не смысл. Такой текст читается без сверки с записью, и правки в нём косметические.
Как это мерилось
- Один нормализатор на эталон и на все гипотезы. Нижний регистр, ё→е, снятие пунктуации, дефис в пробел, числа словами. Асимметрия здесь искажает результат сильнее любой другой ошибки, поэтому правила лежат в репозитории отдельным файлом с семьюдесятью одной проверкой.
- Записи с цифрами в эталоне исключены из основного счёта: «двадцать» и «20» — одно и то же слово, и разнобой записи чисел давал бы ошибки там, где их нет.
- Счётчик — библиотека jiwer, а не самописный. К самописному были бы вопросы, и справедливые.
- Скорость снята на боевой машине сервиса, 12 ядер, без видеокарты. Машина общая: рядом работают посторонние службы, и во время прогона её загрузка колебалась. Значит это скорость в реальных условиях работающего сервера, а не потолок железа.
- Набор из коротких записей — в среднем меньше пяти секунд. Постоянные издержки на запуск не размазываются по длительности, поэтому на длинной записи скорость выше: отдельный замер на записи 25 минут дал ×13 вместо табличных ×4,9–8,4.
Чего этот замер не показывает
- Телефонию 8 кГц. Открытого русского набора с пригодной лицензией не существует. Мерить на закрытом и публиковать цифру, которую нельзя перепроверить, было бы хуже, чем не публиковать.
- Точность разделения по голосам. Эталонной разметки по говорящим для русского в открытом доступе тоже нет. Это следующая работа: разметить свой набор и опубликовать вместе с методикой.
- Сравнение с другими сервисами. Требует прогнать чужие системы по этой же методике, а часть провайдеров запрещает такое использование в соглашении.
Вопросы
Почему две цифры, а не одна?
Потому что одна была бы обманом. На подготовленной начитке ошибок 6,7 %, на живой спонтанной речи — до 12,8 %. Это разница в два раза, и зависит она от материала сильнее, чем от системы. Любой сервис, который называет одно число без описания записей, на которых оно получено, сообщает не о качестве, а о выбранном наборе.
Что такое WER и почему 7 % — это хорошо?
WER — доля слов, которые пришлось бы исправить: замены, пропуски и лишние слова, делённые на число слов в эталоне. 7 % означает, что в среднем на страницу текста набирается около двадцати правок, и почти все они мелкие. Читаемость при этом сохраняется полностью: смысл понятен без сверки с записью.
Почему пунктуация меряется отдельно?
Иначе наши модели выглядели бы хуже, чем есть. Они сами расставляют знаки, а эталоны в открытых наборах в основном без пунктуации — и каждая правильно поставленная запятая шла бы в ошибки. Поэтому WER считается на текстах без знаков и без цифр, а пунктуация оценивается своей метрикой там, где эталон её содержит.
Замер сделан на видеокарте?
Нет, всё на обычном процессоре — видеокарты в сервисе нет вообще. Это осознанный выбор: на процессоре час записи разбирается за минуты, а стоимость обработки в разы ниже. На видеокарте те же модели работали бы кратно быстрее.
Можно ли повторить замер?
Да, это и есть смысл публикации. Наборы открытые, скрипты прогона и правила нормализации лежат в каталоге bench репозитория вместе с контрольными суммами файлов. Один нормализатор применяется и к эталону, и к каждой гипотезе — асимметрия здесь дороже любой другой ошибки методики.
Почему нет сравнения с другими сервисами?
Потому что честное сравнение требует прогнать чужие системы по этой же методике, а часть облачных провайдеров запрещает такое использование в своих соглашениях. Сравнение появится, когда будет юридически чистым. До тех пор здесь только свои цифры — зато проверяемые.
Проверить на своей записи: загрузите файл — первые три минуты без регистрации. Термины: WER, RTF, диаризация. Цены — на отдельной странице.
Наборы данных: Russian LibriSpeech (CC BY 4.0), Golos (SberDevices), SOVA RuDevices (CC BY 4.0). Пофайловые эталоны и гипотезы по наборам с условием ShareAlike не публикуются — только агрегаты и контрольные суммы.