Таймкоды
Таймкоды — привязка расшифровки к времени записи. Они бывают по абзацу, по реплике и по каждому слову; от подробности зависит, можно ли собрать из текста субтитры, проверить цитату или нарезать видео.
Три уровня точности
Таймкоды бывают разной подробности, и от этого зависит, что с расшифровкой можно делать. Разница принципиальная: с точностью до абзаца нельзя ни собрать субтитры, ни проверить цитату.
- По абзацу или блоку — «примерно на пятой минуте». Годится для навигации по длинной записи, больше ни для чего.
- По реплике — начало и конец фразы. Достаточно для субтитров и для поиска места в записи.
- По слову — время начала и конца каждого слова. Позволяет резать видео по фразе, подсвечивать текст синхронно со звуком и проверять спорную цитату.
Зачем нужна точность до слова
- Субтитры: строка должна появляться и исчезать вместе с речью, иначе зритель читает то, что уже сказано.
- Проверка цитаты: спор «я такого не говорил» решается секундой на таймлайне, а не пересматриванием записи.
- Монтаж: нужный фрагмент находится поиском по тексту, а не на слух — это единственный способ работать с многочасовым материалом.
- Синхронная подсветка: слово выделяется в такт звуку, и вычитка расшифровки идёт вдвое быстрее.
Форматы выгрузки
- TXT — текст с таймкодом у каждой реплики и именем говорящего: для чтения и рассылки.
- SRT — субтитры: пары «время — строка», кладутся в плеер и монтажную программу как есть.
- JSON — полные данные: границы каждого слова, метки говорящих, служебные поля. Для интеграции в свою систему.
Почему таймкод не всегда совпадает со слышимым началом слова
Граница слова — не точка, а область: в живой речи слова наезжают друг на друга, а согласные на стыке произносятся один раз на два слова. Расхождение в несколько десятков миллисекунд — норма, и на субтитрах оно незаметно. Заметным оно становится там, где режут видео строго по границе, — поэтому монтажники обычно берут небольшой запас.
Вопросы
Да. Демо без регистрации отдаёт те же таймкоды и ту же выгрузку SRT, что и платный режим, — ограничена только длительность записи.
Да, в выгрузке JSON у каждого слова своё время начала и конца. В TXT и SRT они сведены до реплик — иначе текст невозможно читать.
Время считается от начала загруженного файла. Если вы вырезали середину записи до загрузки, таймкоды будут относиться к обрезанной версии, а не к исходной.
Нет. Участки без речи в распознавание не попадают, но время продолжает идти — на месте вставки будет просто пропуск.