Расшифровка интервью
Загрузите запись интервью — получите текст, где вопросы и ответы разделены по голосам, у говорящих стоят имена, а у каждой реплики есть таймкод для проверки цитаты.
Три минуты бесплатно · до 2 ГБ на файл
Интервью без разделения по голосам расшифровывать бессмысленно
Обычное распознавание отдаёт сплошной текст. В интервью это худший из возможных результатов: непонятно, где кончился вопрос и началась мысль собеседника, а именно она вам и нужна. Разбирать такую стену вручную дольше, чем набрать текст с нуля.
Поэтому реплики делятся по говорящим, а говорящие получают имена — не «Спикер 1» и «Спикер 2», а те, что вы поставили один раз:
Голос запоминается на организацию: если вы берёте у человека второе интервью, имя подставится само — размечать заново не нужно.
Цитата с таймкодом — чтобы можно было проверить
Расшифровка нужна не сама по себе: из неё берут цитаты, и каждую придётся защищать — перед редактором, юристом, а иногда и перед самим собеседником. Поэтому таймкод стоит у каждого слова, а не только у абзаца.
- Согласование текста. Собеседник просит убрать фразу — вы за секунду находите её в записи и слышите контекст целиком.
- Спор о точности. «Я такого не говорил» проверяется не памятью, а секундой на таймлайне.
- Монтаж подкаста или видео. Выгрузка SRT кладётся в монтажную программу, и нужный фрагмент ищется по тексту, а не на слух.
Что мешает распознаванию интервью и что с этим делать
- Разговор в кафе. Фоновая музыка и посуда сбивают сильнее, чем гул улицы. Диктофон ближе к собеседнику — это важнее любых настроек.
- Перебивания. Когда двое говорят одновременно, реплики на этом отрезке могут смешаться: разделение опирается на голос, а голоса наложены.
- Звонок вместо встречи. Телефония режет полосу до 8 кГц, шипящие теряются. Текст читается, но фамилии и цифры стоит проверить по записи.
- Термины и незнакомые имена. Перечислите их через запятую в подсказках — распознанные похожие слова будут заменены на ваше написание.
Вопросы
Как отличить вопросы интервьюера от ответов?
Сервис делит запись по голосам сам, без разметки. Дальше вы один раз называете говорящих — «Ведущий», «Иван Петров» — и имена подставляются во все реплики. В следующей записи с тем же человеком сервис узнаёт его голос и подставит имя сразу.
А если интервью записано на один микрофон?
Так и работает в большинстве случаев: разделение идёт по голосовому отпечатку, а не по каналам записи. Один диктофон на столе между двумя людьми — обычная ситуация, и она разбирается.
Сколько говорящих сервис различает?
Число определяется автоматически, заранее указывать не нужно. Разговор на двоих, круглый стол на пятерых — считает по записи.
Можно ли получить таймкод для цитаты?
Таймкод есть у каждого слова. В выгрузке TXT он стоит у каждой реплики, в SRT — на каждом отрезке; по нему вы находите место в записи и проверяете цитату перед публикацией.
Что с расшифровкой длинного интервью на два часа?
Ограничения по длительности в платном режиме нет, два часа обрабатываются примерно за десять-двенадцать минут. Бесплатно без регистрации — первые три минуты записи.