MP3 в текст
Загрузите mp3-файл — получите текст с пунктуацией, таймкодами и разделением по голосам. Перекодировать ничего не нужно.
Три минуты бесплатно · до 2 ГБ на файл
Что важно знать про mp3 перед расшифровкой
mp3 — формат с потерями: при сжатии выбрасывается то, что человек почти не слышит. Слух этого не замечает, а распознавание речи опирается ровно на такие мелкие детали — поэтому у mp3 есть порог, ниже которого текст начинает сыпаться.
- 128 кбит/с и выше — потерь для распознавания практически нет, результат как с несжатой записи.
- 64–96 кбит/с — обычный режим диктофонов и голосовых. Работает нормально, шипящие иногда путаются.
- 32 кбит/с и ниже — выгрузки из телефонии и старые архивы. Смысл фраз сохраняется, но точных цифр и имён ждать не стоит.
Откуда обычно берутся такие файлы
mp3 приходит из очень разных мест, и от источника зависит больше, чем от формата:
- Диктофон на столе — далёкая речь с эхом, несколько говорящих.
- Выгрузка из телефонии — узкая полоса 8 кГц, часто моно.
- Запись из ВКС — чистый ближний звук, но говорящие уже смешаны в одну дорожку.
- Подкаст или лекция — самый удобный материал: один микрофон, ровная речь.
Вопросы
Битрейт влияет на точность?
Слабо, пока он выше 64 кбит/с. Ниже начинают пропадать высокие частоты, и путаются согласные — «с» и «ш», «т» и «п».
Моно или стерео — что лучше?
Для одного говорящего разницы нет. Для звонка стерео полезно: если каналы разведены, оператор и клиент делятся точно.
Нужно ли перекодировать mp3 в wav?
Нет. Обратное преобразование не возвращает потерянное при сжатии, а лишний проход только добавляет искажений.
Какой длительности файл принимается?
Три минуты бесплатно, в платном режиме ограничения нет. Час записи обрабатывается примерно за пять минут.
Что на выходе?
Текст с пунктуацией, реплики по говорящим, таймкод у каждого слова, выгрузка в TXT, SRT и JSON.