Расшифровка интервью

Загрузите запись интервью — получите текст, где вопросы и ответы разделены по голосам, у говорящих стоят имена, а у каждой реплики есть таймкод для проверки цитаты.

Три минуты бесплатно · до 2 ГБ на файл

Интервью без разделения по голосам расшифровывать бессмысленно

Обычное распознавание отдаёт сплошной текст. В интервью это худший из возможных результатов: непонятно, где кончился вопрос и началась мысль собеседника, а именно она вам и нужна. Разбирать такую стену вручную дольше, чем набрать текст с нуля.

Поэтому реплики делятся по говорящим, а говорящие получают имена — не «Спикер 1» и «Спикер 2», а те, что вы поставили один раз:

[00:00:14] Ведущий: Вы говорили, что решение принималось за неделю. Кто его принимал?
[00:00:21] Иван Петров: Формально — совет директоров. По факту всё было решено на встрече втроём, в пятницу вечером.
[00:00:33] Ведущий: То есть протокол оформили позже?

Голос запоминается на организацию: если вы берёте у человека второе интервью, имя подставится само — размечать заново не нужно.

Цитата с таймкодом — чтобы можно было проверить

Расшифровка нужна не сама по себе: из неё берут цитаты, и каждую придётся защищать — перед редактором, юристом, а иногда и перед самим собеседником. Поэтому таймкод стоит у каждого слова, а не только у абзаца.

  • Согласование текста. Собеседник просит убрать фразу — вы за секунду находите её в записи и слышите контекст целиком.
  • Спор о точности. «Я такого не говорил» проверяется не памятью, а секундой на таймлайне.
  • Монтаж подкаста или видео. Выгрузка SRT кладётся в монтажную программу, и нужный фрагмент ищется по тексту, а не на слух.
Про имена в тексте. Имя говорящего хранится отдельно от расшифровки и подставляется при чтении. Это важно для интервью: если вы переименуете участника или уточните фамилию, весь ранее расшифрованный материал обновится сам — править сотни реплик поиском по файлу не нужно.

Что мешает распознаванию интервью и что с этим делать

  • Разговор в кафе. Фоновая музыка и посуда сбивают сильнее, чем гул улицы. Диктофон ближе к собеседнику — это важнее любых настроек.
  • Перебивания. Когда двое говорят одновременно, реплики на этом отрезке могут смешаться: разделение опирается на голос, а голоса наложены.
  • Звонок вместо встречи. Телефония режет полосу до 8 кГц, шипящие теряются. Текст читается, но фамилии и цифры стоит проверить по записи.
  • Термины и незнакомые имена. Перечислите их через запятую в подсказках — распознанные похожие слова будут заменены на ваше написание.

Вопросы

Как отличить вопросы интервьюера от ответов?

Сервис делит запись по голосам сам, без разметки. Дальше вы один раз называете говорящих — «Ведущий», «Иван Петров» — и имена подставляются во все реплики. В следующей записи с тем же человеком сервис узнаёт его голос и подставит имя сразу.

А если интервью записано на один микрофон?

Так и работает в большинстве случаев: разделение идёт по голосовому отпечатку, а не по каналам записи. Один диктофон на столе между двумя людьми — обычная ситуация, и она разбирается.

Сколько говорящих сервис различает?

Число определяется автоматически, заранее указывать не нужно. Разговор на двоих, круглый стол на пятерых — считает по записи.

Можно ли получить таймкод для цитаты?

Таймкод есть у каждого слова. В выгрузке TXT он стоит у каждой реплики, в SRT — на каждом отрезке; по нему вы находите место в записи и проверяете цитату перед публикацией.

Что с расшифровкой длинного интервью на два часа?

Ограничения по длительности в платном режиме нет, два часа обрабатываются примерно за десять-двенадцать минут. Бесплатно без регистрации — первые три минуты записи.

Ещё:аудиозапись в текстзапись с диктофоначто такое диаризациясколько стоит