OGG в текст

Загрузите ogg-файл — получите текст с пунктуацией и таймкодами. Голосовые из мессенджеров принимаются как есть, конвертировать не нужно.

Три минуты бесплатно · до 2 ГБ на файл

Ogg — это почти всегда голосовое сообщение

Если у вас на руках ogg, он с высокой вероятностью пришёл из мессенджера: и WhatsApp, и Telegram пишут голосовые в контейнер ogg с кодеком Opus. Это важно понимать, потому что дальше вопросы про формат сменяются вопросами про манеру речи — она в голосовых совсем другая, чем в диктофонной записи.

  • Opus в ogg — голосовые мессенджеров, запись из браузера, игровые чаты.
  • Vorbis в ogg — старый вариант: музыка, подкасты десятилетней давности, экспорт из Audacity.
  • Расширение .oga или .opus — тот же контейнер под другим именем, читается так же.

Почему у Opus низкий битрейт — не приговор

Голосовое на две минуты весит четверть мегабайта, и это пугает: у mp3 такой битрейт означал бы кашу вместо слов. Разница в том, для чего кодеки создавались. Opus умеет переключаться в режим речи и тратит поток именно на то, что различает звуки, а не на весь звуковой диапазон.

ПотокOpusMP3 на том же потоке
16–24 кбит/сречь разборчива, текст читаетсяречь глухая, много ошибок
32–48 кбит/скак с диктофонаприемлемо, шипящие путаются
64 кбит/с и вышепотерь для распознавания нетпотерь для распознавания нет

Вывод простой: не перекодируйте ogg в mp3 «для совместимости». Это ухудшит запись ровно на один лишний проход сжатия и ничего не даст.

Что действительно мешает в голосовых

  • Ветер и улица. Микрофон телефона у рта, ветер прямо в него — самый частый источник ошибок в голосовых.
  • Речь на ходу. Сбитое дыхание, обрывы фраз, слова проглатываются — текст получается таким же рваным, как и речь.
  • Громкая связь на стороне собеседника. Голос идёт через динамик и записывается с эхом; разделение по голосам это переживает, точность падает.
  • Термины и имена. Перечислите их в подсказках через запятую — распознанные похожие слова заменятся на ваше написание.

Вопросы

Голосовое из WhatsApp или Telegram подойдёт?

Да, именно такие файлы чаще всего и приходят: мессенджеры пишут голосовые в ogg с кодеком Opus. Перекодировать не нужно, загружайте файл как есть.

Opus и Vorbis — есть разница для распознавания?

Практической нет, оба читаются. Opus заметно лучше держит речь на низком битрейте, поэтому современные голосовые в нём и пишут.

Битрейт голосового всего 24 кбит/с — это плохо?

Для Opus это нормальный режим речи: кодек рассчитан именно на такие потоки и сохраняет разборчивость. У mp3 на 24 кбит/с речь была бы уже почти нечитаемой.

Почему в тексте голосового больше ошибок, чем в диктофонной записи?

Дело обычно не в формате, а в манере: голосовые записывают на ходу, в транспорте, с ветром в микрофон и оборванными фразами. Формат тут страдает меньше всего.

Можно загрузить сразу несколько голосовых?

Каждый файл обрабатывается отдельно. Если переписка длинная, удобнее склеить голосовые в один файл — тогда и разделение по голосам сработает на всю беседу целиком.

Ещё:голосовое в текстконвертер аудио в текстmp3 в текстчто такое диаризациясколько стоит