Таймкоды

Таймкоды — привязка расшифровки к времени записи. Они бывают по абзацу, по реплике и по каждому слову; от подробности зависит, можно ли собрать из текста субтитры, проверить цитату или нарезать видео.

Три уровня точности

Таймкоды бывают разной подробности, и от этого зависит, что с расшифровкой можно делать. Разница принципиальная: с точностью до абзаца нельзя ни собрать субтитры, ни проверить цитату.

  • По абзацу или блоку — «примерно на пятой минуте». Годится для навигации по длинной записи, больше ни для чего.
  • По реплике — начало и конец фразы. Достаточно для субтитров и для поиска места в записи.
  • По слову — время начала и конца каждого слова. Позволяет резать видео по фразе, подсвечивать текст синхронно со звуком и проверять спорную цитату.

Зачем нужна точность до слова

  • Субтитры: строка должна появляться и исчезать вместе с речью, иначе зритель читает то, что уже сказано.
  • Проверка цитаты: спор «я такого не говорил» решается секундой на таймлайне, а не пересматриванием записи.
  • Монтаж: нужный фрагмент находится поиском по тексту, а не на слух — это единственный способ работать с многочасовым материалом.
  • Синхронная подсветка: слово выделяется в такт звуку, и вычитка расшифровки идёт вдвое быстрее.

Форматы выгрузки

  • TXT — текст с таймкодом у каждой реплики и именем говорящего: для чтения и рассылки.
  • SRT — субтитры: пары «время — строка», кладутся в плеер и монтажную программу как есть.
  • JSON — полные данные: границы каждого слова, метки говорящих, служебные поля. Для интеграции в свою систему.

Почему таймкод не всегда совпадает со слышимым началом слова

Граница слова — не точка, а область: в живой речи слова наезжают друг на друга, а согласные на стыке произносятся один раз на два слова. Расхождение в несколько десятков миллисекунд — норма, и на субтитрах оно незаметно. Заметным оно становится там, где режут видео строго по границе, — поэтому монтажники обычно берут небольшой запас.

Вопросы

Таймкоды есть в бесплатном режиме?

Да. Демо без регистрации отдаёт те же таймкоды и ту же выгрузку SRT, что и платный режим, — ограничена только длительность записи.

Можно ли получить таймкоды по каждому слову, а не по фразе?

Да, в выгрузке JSON у каждого слова своё время начала и конца. В TXT и SRT они сведены до реплик — иначе текст невозможно читать.

Как таймкоды ведут себя при вырезанных фрагментах?

Время считается от начала загруженного файла. Если вы вырезали середину записи до загрузки, таймкоды будут относиться к обрезанной версии, а не к исходной.

Сдвигаются ли таймкоды на музыкальных вставках?

Нет. Участки без речи в распознавание не попадают, но время продолжает идти — на месте вставки будет просто пропуск.

Ещё:субтитры к видеодиаризацияVAD — поиск речисколько стоит