Подкаст в текст
Загрузите выпуск — получите текст с разделением на ведущего и гостей, именами и таймкодами. Из него собираются шоуноты, главы и цитаты для соцсетей.
Три минуты бесплатно · до 2 ГБ на файл
Одна дорожка или несколько — что делать в каждом случае
Подкаст пишут по-разному, и от этого зависит, как лучше расшифровывать. Разница принципиальная: в одном случае сервис определяет говорящих сам, в другом вы знаете их заранее и точность разделения становится абсолютной.
- Готовый смикшированный выпуск — обычный случай. Загружайте файл целиком: ведущий и гости разделятся по голосам, вы поставите им имена один раз.
- Отдельные дорожки участников — студийная запись или запись через сервис удалённой записи. Расшифруйте каждую дорожку отдельно: принадлежность реплик известна без всякого распознавания, а таймкоды у дорожек общие, поэтому тексты сводятся в один по времени.
- Выпуск с телефонным гостем — самый неудобный вариант по качеству звука, зато самый простой для разделения: узкая полоса связи звучит совершенно иначе, чем студийный микрофон.
Зачем подкасту текстовая версия
Аудио не индексируется поиском и не читается по диагонали. Текст выпуска решает сразу несколько задач, причём почти без вашего времени:
- Шоуноты и описание. Темы выпуска берутся из текста, а не восстанавливаются по памяти после сведения.
- Главы с таймкодами. У каждого слова есть время, поэтому метки глав ставятся по тексту — искать переходы на слух не нужно.
- Цитаты для соцсетей. Реплика с именем говорящего и точной секундой годится и в карточку, и в нарезку видео.
- Страница выпуска для поиска. Полная расшифровка — это текст, по которому выпуск вообще может быть найден в Яндексе.
Мелочи, которые портят расшифровку выпуска
- Сильная компрессия на мастере. Ровная громкость приятна слушателю, но выравнивает и голоса — разделять их становится чуть труднее. Если есть версия до мастеринга, расшифровывайте её.
- Фоновая музыка под речью. Речь распознаётся, но на тихих репликах поверх музыки ошибок больше.
- Имена, названия, англицизмы. Перечислите их в подсказках через запятую — распознанные похожие слова заменятся на ваше написание, и не придётся править «эйчар» и «дэшборд» по всему выпуску.
- Смех и одновременная речь. Там, где все говорят разом, реплики могут смешаться: голоса наложены, разделять нечего.
Вопросы
У меня отдельные дорожки ведущего и гостя. Как лучше?
Оба варианта рабочие. Смикшированный файл сервис разделит по голосам сам. Если дорожки отдельные, расшифруйте каждую по отдельности — тогда принадлежность реплик известна точно, а таймкоды у дорожек общие, и тексты сводятся по времени.
Гость записан по связи и звучит хуже — это проблема?
Текст по такой дорожке будет чуть слабее, чем по студийной, но разделение от этого только выигрывает: голос по связи заметно отличается от студийного, и спутать их трудно.
Можно ли получить текст для шоунот и глав?
Да. У каждого слова есть таймкод, поэтому темы выпуска и метки глав расставляются по тексту, а не на слух. Выгрузка — TXT, SRT, JSON.
Что с музыкальными вставками и джинглами?
Музыка в текст не попадает — распознаётся речь. На месте вставки будет просто пропуск во времени, таймкоды дальше не сдвигаются.
Выпуск на час — сколько ждать?
Примерно пять-шесть минут на обычном процессоре. Ограничения по длительности в платном режиме нет, бесплатно без регистрации — три минуты записи.