OGG в текст
Загрузите ogg-файл — получите текст с пунктуацией и таймкодами. Голосовые из мессенджеров принимаются как есть, конвертировать не нужно.
Три минуты бесплатно · до 2 ГБ на файл
Ogg — это почти всегда голосовое сообщение
Если у вас на руках ogg, он с высокой вероятностью пришёл из мессенджера: и WhatsApp, и Telegram пишут голосовые в контейнер ogg с кодеком Opus. Это важно понимать, потому что дальше вопросы про формат сменяются вопросами про манеру речи — она в голосовых совсем другая, чем в диктофонной записи.
- Opus в ogg — голосовые мессенджеров, запись из браузера, игровые чаты.
- Vorbis в ogg — старый вариант: музыка, подкасты десятилетней давности, экспорт из Audacity.
- Расширение .oga или .opus — тот же контейнер под другим именем, читается так же.
Почему у Opus низкий битрейт — не приговор
Голосовое на две минуты весит четверть мегабайта, и это пугает: у mp3 такой битрейт означал бы кашу вместо слов. Разница в том, для чего кодеки создавались. Opus умеет переключаться в режим речи и тратит поток именно на то, что различает звуки, а не на весь звуковой диапазон.
| Поток | Opus | MP3 на том же потоке |
|---|---|---|
| 16–24 кбит/с | речь разборчива, текст читается | речь глухая, много ошибок |
| 32–48 кбит/с | как с диктофона | приемлемо, шипящие путаются |
| 64 кбит/с и выше | потерь для распознавания нет | потерь для распознавания нет |
Вывод простой: не перекодируйте ogg в mp3 «для совместимости». Это ухудшит запись ровно на один лишний проход сжатия и ничего не даст.
Что действительно мешает в голосовых
- Ветер и улица. Микрофон телефона у рта, ветер прямо в него — самый частый источник ошибок в голосовых.
- Речь на ходу. Сбитое дыхание, обрывы фраз, слова проглатываются — текст получается таким же рваным, как и речь.
- Громкая связь на стороне собеседника. Голос идёт через динамик и записывается с эхом; разделение по голосам это переживает, точность падает.
- Термины и имена. Перечислите их в подсказках через запятую — распознанные похожие слова заменятся на ваше написание.
Вопросы
Голосовое из WhatsApp или Telegram подойдёт?
Да, именно такие файлы чаще всего и приходят: мессенджеры пишут голосовые в ogg с кодеком Opus. Перекодировать не нужно, загружайте файл как есть.
Opus и Vorbis — есть разница для распознавания?
Практической нет, оба читаются. Opus заметно лучше держит речь на низком битрейте, поэтому современные голосовые в нём и пишут.
Битрейт голосового всего 24 кбит/с — это плохо?
Для Opus это нормальный режим речи: кодек рассчитан именно на такие потоки и сохраняет разборчивость. У mp3 на 24 кбит/с речь была бы уже почти нечитаемой.
Почему в тексте голосового больше ошибок, чем в диктофонной записи?
Дело обычно не в формате, а в манере: голосовые записывают на ходу, в транспорте, с ветром в микрофон и оборванными фразами. Формат тут страдает меньше всего.
Можно загрузить сразу несколько голосовых?
Каждый файл обрабатывается отдельно. Если переписка длинная, удобнее склеить голосовые в один файл — тогда и разделение по голосам сработает на всю беседу целиком.