Whisper на русском или готовый сервис — что выбрать

Честное сравнение с цифрами из открытых замеров, включая те, где Whisper выигрывает. Если после этой страницы вы поставите Whisper себе — она сработала правильно.

Ниже можно сразу проверить, как справляется сервис: три минуты без регистрации

Бесплатно: запись до 3 минут и файл до 20 МБ — для mp3, m4a и ogg это с большим запасом

Коротко: это разные инструменты

Whisper — модель, которую вы запускаете сами. Этот сервис — готовая обработка, куда вы отдаёте файл. Сравнивать их «кто точнее» можно, но выбор чаще решается не точностью, а тем, есть ли у вас желание держать своё железо и настраивать разделение говорящих отдельно.

Whisper у себяЗдесь
Где работаетна вашем железе, без интернетана нашей стороне, из браузера или по API
Языкиоколо сотнирусский, и всё внимание ему
Кто говоритне определяет — нужна отдельная модельразделяет и подписывает именами
Имена между записяминетузнаёт постоянного участника
Знаки препинанияесть, качество на русском зависит от версииставит сама модель
Что нужно от васмашина, настройка, обслуживаниезагрузить файл
Ценабесплатно, кроме своего железа и времени0,30 ₽ за минуту, первые три без регистрации

Точность: три замера, и они не сходятся

Ниже — доля слов, которые пришлось бы исправить (меньше значит лучше). Важно, чей это замер: авторы модели считают на своём наборе, независимые исследователи — на своём, и расхождение между ними больше, чем разница между самими моделями.

  • Замер авторов GigaAM, десять наборов. Whisper large-v3 — 21,0 % в среднем, модель этого сервиса — 11,2 %. Это замер разработчиков модели, и относиться к нему нужно как к таковому.
  • Независимая проверка, июнь 2026. На студийной речи паритет: Whisper turbo 7,28 % против 7,89 %. На шумном материале с YouTube Whisper впереди — 26,9 % против 28,3 %.
  • Независимый обзор, сентябрь 2025 (автор Vosk): семейство GigaAM в среднем 8,42 % против 16,2–16,8 % у разных версий Whisper, включая записи телефонных разговоров.
  • Наш собственный прогон — 2398 записей: 6,71 % на подготовленной начитке, 8,76 % на спонтанной речи и 12,81 % на самом трудном наборе. Методика и скрипты открыты, цифры можно перепроверить.

Вывод, который эти цифры позволяют сделать честно: на чистой русской речи разница невелика, на шуме преимущества нет ни у кого, а на телефонных записях выигрывает не Whisper. Вывод, который они НЕ позволяют сделать: «распознаём лучше всех».

Когда правильнее взять Whisper

  • Записи нельзя выпускать за пределы своего контура — тогда вопрос закрыт, и это правильное решение.
  • Нужны десятки языков, а не русский.
  • Объёмы большие и постоянные, своё железо уже есть, а инженерное время — дешевле минут.
  • Задача разовая и техническая: разобрать архив, поэкспериментировать, встроить в собственный конвейер.

Когда своё запускать не стоит

Если нужен не «текст», а готовая расшифровка встречи: реплики разложены по людям, люди названы по именам, знаки препинания на месте, время у каждого слова. Whisper даёт первый шаг из этой цепочки — распознавание. Остальное придётся собирать: ставить модель разделения голосов, придумывать, как хранить отпечаток голоса участника между записями, сшивать длинные файлы, править числа и знаки. Это не месяц работы одного человека, но и не вечер.

Вопросы

Что такое Whisper?

Открытая модель распознавания речи от OpenAI. Её выкладывают весами, поэтому её можно запустить на своём сервере или ноутбуке бесплатно и без интернета. Понимает около сотни языков, русский — один из них.

Whisper точнее на русском?

Зависит от материала, и однозначного ответа нет. По замеру авторов GigaAM на десяти наборах Whisper large-v3 даёт в среднем 21,0 % ошибок в словах против 11,2 % у модели, на которой работает этот сервис. Но независимая проверка (П. Борисов, июнь 2026) на студийной речи показала паритет — 7,28 % против 7,89 %, — а на шумном материале с YouTube Whisper оказался лучше: 26,9 % против 28,3 %. Разница между «в среднем» и «на вашей записи» здесь больше, чем разница между моделями.

Whisper сам разделяет говорящих?

Нет. Whisper выдаёт сплошной текст с временем по фразам и не отвечает на вопрос, кто говорит. Разделение по голосам делается отдельной моделью, которую надо поставить, настроить и связать с распознаванием, а имена участников в любом случае придётся присваивать самому.

Что нужно, чтобы запустить Whisper самому?

Машина с достаточной памятью (для крупных версий — видеокарта), установленное окружение, скачанные веса и время на настройку. Дальше — обработка длинных записей частями, склейка результата и своя постановка знаков препинания, если она нужна.

Чем этот сервис отличается от запуска Whisper у себя?

Тремя вещами: разделение по голосам с именами участников, которые узнаются между разными записями; знаки препинания и числа сразу в нужном виде; ничего не нужно ставить и обслуживать. Взамен запись обрабатывается на нашей стороне и обработка платная — 0,30 ₽ за минуту.

Можно проверить ваши цифры?

Да, на странице открытого замера: 2398 записей, три открытых набора, правила нормализации и скрипты опубликованы. Это и есть причина, по которой на этой странице приведены и те цифры, где выигрывает Whisper.

Похожие страницы:открытый замер точности с методикойкак устроено разделение по голосамдоступ из своего кодапросто расшифровать записьсколько стоит