Whisper на русском или готовый сервис — что выбрать
Честное сравнение с цифрами из открытых замеров, включая те, где Whisper выигрывает. Если после этой страницы вы поставите Whisper себе — она сработала правильно.
Ниже можно сразу проверить, как справляется сервис: три минуты без регистрации
Бесплатно: запись до 3 минут и файл до 20 МБ — для mp3, m4a и ogg это с большим запасом
Коротко: это разные инструменты
Whisper — модель, которую вы запускаете сами. Этот сервис — готовая обработка, куда вы отдаёте файл. Сравнивать их «кто точнее» можно, но выбор чаще решается не точностью, а тем, есть ли у вас желание держать своё железо и настраивать разделение говорящих отдельно.
| Whisper у себя | Здесь | |
|---|---|---|
| Где работает | на вашем железе, без интернета | на нашей стороне, из браузера или по API |
| Языки | около сотни | русский, и всё внимание ему |
| Кто говорит | не определяет — нужна отдельная модель | разделяет и подписывает именами |
| Имена между записями | нет | узнаёт постоянного участника |
| Знаки препинания | есть, качество на русском зависит от версии | ставит сама модель |
| Что нужно от вас | машина, настройка, обслуживание | загрузить файл |
| Цена | бесплатно, кроме своего железа и времени | 0,30 ₽ за минуту, первые три без регистрации |
Точность: три замера, и они не сходятся
Ниже — доля слов, которые пришлось бы исправить (меньше значит лучше). Важно, чей это замер: авторы модели считают на своём наборе, независимые исследователи — на своём, и расхождение между ними больше, чем разница между самими моделями.
- Замер авторов GigaAM, десять наборов. Whisper large-v3 — 21,0 % в среднем, модель этого сервиса — 11,2 %. Это замер разработчиков модели, и относиться к нему нужно как к таковому.
- Независимая проверка, июнь 2026. На студийной речи паритет: Whisper turbo 7,28 % против 7,89 %. На шумном материале с YouTube Whisper впереди — 26,9 % против 28,3 %.
- Независимый обзор, сентябрь 2025 (автор Vosk): семейство GigaAM в среднем 8,42 % против 16,2–16,8 % у разных версий Whisper, включая записи телефонных разговоров.
- Наш собственный прогон — 2398 записей: 6,71 % на подготовленной начитке, 8,76 % на спонтанной речи и 12,81 % на самом трудном наборе. Методика и скрипты открыты, цифры можно перепроверить.
Вывод, который эти цифры позволяют сделать честно: на чистой русской речи разница невелика, на шуме преимущества нет ни у кого, а на телефонных записях выигрывает не Whisper. Вывод, который они НЕ позволяют сделать: «распознаём лучше всех».
Когда правильнее взять Whisper
- Записи нельзя выпускать за пределы своего контура — тогда вопрос закрыт, и это правильное решение.
- Нужны десятки языков, а не русский.
- Объёмы большие и постоянные, своё железо уже есть, а инженерное время — дешевле минут.
- Задача разовая и техническая: разобрать архив, поэкспериментировать, встроить в собственный конвейер.
Когда своё запускать не стоит
Если нужен не «текст», а готовая расшифровка встречи: реплики разложены по людям, люди названы по именам, знаки препинания на месте, время у каждого слова. Whisper даёт первый шаг из этой цепочки — распознавание. Остальное придётся собирать: ставить модель разделения голосов, придумывать, как хранить отпечаток голоса участника между записями, сшивать длинные файлы, править числа и знаки. Это не месяц работы одного человека, но и не вечер.
Вопросы
Что такое Whisper?
Открытая модель распознавания речи от OpenAI. Её выкладывают весами, поэтому её можно запустить на своём сервере или ноутбуке бесплатно и без интернета. Понимает около сотни языков, русский — один из них.
Whisper точнее на русском?
Зависит от материала, и однозначного ответа нет. По замеру авторов GigaAM на десяти наборах Whisper large-v3 даёт в среднем 21,0 % ошибок в словах против 11,2 % у модели, на которой работает этот сервис. Но независимая проверка (П. Борисов, июнь 2026) на студийной речи показала паритет — 7,28 % против 7,89 %, — а на шумном материале с YouTube Whisper оказался лучше: 26,9 % против 28,3 %. Разница между «в среднем» и «на вашей записи» здесь больше, чем разница между моделями.
Whisper сам разделяет говорящих?
Нет. Whisper выдаёт сплошной текст с временем по фразам и не отвечает на вопрос, кто говорит. Разделение по голосам делается отдельной моделью, которую надо поставить, настроить и связать с распознаванием, а имена участников в любом случае придётся присваивать самому.
Что нужно, чтобы запустить Whisper самому?
Машина с достаточной памятью (для крупных версий — видеокарта), установленное окружение, скачанные веса и время на настройку. Дальше — обработка длинных записей частями, склейка результата и своя постановка знаков препинания, если она нужна.
Чем этот сервис отличается от запуска Whisper у себя?
Тремя вещами: разделение по голосам с именами участников, которые узнаются между разными записями; знаки препинания и числа сразу в нужном виде; ничего не нужно ставить и обслуживать. Взамен запись обрабатывается на нашей стороне и обработка платная — 0,30 ₽ за минуту.
Можно проверить ваши цифры?
Да, на странице открытого замера: 2398 записей, три открытых набора, правила нормализации и скрипты опубликованы. Это и есть причина, по которой на этой странице приведены и те цифры, где выигрывает Whisper.