Подкаст в текст

Загрузите выпуск — получите текст с разделением на ведущего и гостей, именами и таймкодами. Из него собираются шоуноты, главы и цитаты для соцсетей.

Три минуты бесплатно · до 2 ГБ на файл

Одна дорожка или несколько — что делать в каждом случае

Подкаст пишут по-разному, и от этого зависит, как лучше расшифровывать. Разница принципиальная: в одном случае сервис определяет говорящих сам, в другом вы знаете их заранее и точность разделения становится абсолютной.

  • Готовый смикшированный выпуск — обычный случай. Загружайте файл целиком: ведущий и гости разделятся по голосам, вы поставите им имена один раз.
  • Отдельные дорожки участников — студийная запись или запись через сервис удалённой записи. Расшифруйте каждую дорожку отдельно: принадлежность реплик известна без всякого распознавания, а таймкоды у дорожек общие, поэтому тексты сводятся в один по времени.
  • Выпуск с телефонным гостем — самый неудобный вариант по качеству звука, зато самый простой для разделения: узкая полоса связи звучит совершенно иначе, чем студийный микрофон.

Зачем подкасту текстовая версия

Аудио не индексируется поиском и не читается по диагонали. Текст выпуска решает сразу несколько задач, причём почти без вашего времени:

  • Шоуноты и описание. Темы выпуска берутся из текста, а не восстанавливаются по памяти после сведения.
  • Главы с таймкодами. У каждого слова есть время, поэтому метки глав ставятся по тексту — искать переходы на слух не нужно.
  • Цитаты для соцсетей. Реплика с именем говорящего и точной секундой годится и в карточку, и в нарезку видео.
  • Страница выпуска для поиска. Полная расшифровка — это текст, по которому выпуск вообще может быть найден в Яндексе.
[00:04:02] Ведущий: Давай к тому, с чего всё началось. Первый год — что было самым дорогим?
[00:04:11] Гость: Люди. Не сервера, не реклама — люди, причём в первые же три месяца.

Мелочи, которые портят расшифровку выпуска

  • Сильная компрессия на мастере. Ровная громкость приятна слушателю, но выравнивает и голоса — разделять их становится чуть труднее. Если есть версия до мастеринга, расшифровывайте её.
  • Фоновая музыка под речью. Речь распознаётся, но на тихих репликах поверх музыки ошибок больше.
  • Имена, названия, англицизмы. Перечислите их в подсказках через запятую — распознанные похожие слова заменятся на ваше написание, и не придётся править «эйчар» и «дэшборд» по всему выпуску.
  • Смех и одновременная речь. Там, где все говорят разом, реплики могут смешаться: голоса наложены, разделять нечего.

Вопросы

У меня отдельные дорожки ведущего и гостя. Как лучше?

Оба варианта рабочие. Смикшированный файл сервис разделит по голосам сам. Если дорожки отдельные, расшифруйте каждую по отдельности — тогда принадлежность реплик известна точно, а таймкоды у дорожек общие, и тексты сводятся по времени.

Гость записан по связи и звучит хуже — это проблема?

Текст по такой дорожке будет чуть слабее, чем по студийной, но разделение от этого только выигрывает: голос по связи заметно отличается от студийного, и спутать их трудно.

Можно ли получить текст для шоунот и глав?

Да. У каждого слова есть таймкод, поэтому темы выпуска и метки глав расставляются по тексту, а не на слух. Выгрузка — TXT, SRT, JSON.

Что с музыкальными вставками и джинглами?

Музыка в текст не попадает — распознаётся речь. На месте вставки будет просто пропуск во времени, таймкоды дальше не сдвигаются.

Выпуск на час — сколько ждать?

Примерно пять-шесть минут на обычном процессоре. Ограничения по длительности в платном режиме нет, бесплатно без регистрации — три минуты записи.

Ещё:аудио в текст онлайнрасшифровка интервьюсубтитры к видеочто такое диаризациясколько стоит