VAD

VAD (Voice Activity Detection) — определение участков записи, где есть речь. Он находит границы фраз, отбрасывает тишину и шум и режет длинную запись на куски по паузам, а не по таймеру.

Зачем он нужен

Модель распознавания не умеет читать двухчасовой файл целиком: у неё есть предел длины отрезка. Поэтому запись сначала делится на фрагменты — и делить её надо не по таймеру, а по паузам, иначе слово разрежется пополам и не распознается ни в одной из половин. Границы для нарезки и находит VAD.

  • Нарезка длинной записи по паузам, а не по минутам.
  • Отбрасывание участков без речи: тишина, шум кондиционера, стук по столу.
  • Подготовка отрезков для разделения по голосам — считать голосовой отпечаток по тишине бессмысленно.
  • В потоковом режиме — определение конца фразы, чтобы отдать готовый текст, а не ждать вечно.

Что бывает, когда он ошибается

  • Пропущенная тихая речь: сказанное шёпотом на дальнем конце стола принято за тишину — фраза в тексте отсутствует целиком.
  • Шум, принятый за речь: кашель, скрип двери и музыка попадают в распознавание и превращаются в случайные слова.
  • Слишком ранняя граница: фраза обрезана на полуслове, и последнее слово теряется.
  • Слишком поздняя: в один отрезок попадают два говорящих, и разделение по голосам на нём смазывается.

Почему в расшифровке нет пауз и шумов

Это следствие работы VAD, а не «умной чистки текста»: участки без речи в распознавание просто не попадают. Отсюда и полезный побочный эффект — платить за час записи, в котором говорят десять минут, приходится по факту распознанного, а не по длительности файла.

Вопросы

VAD — это шумоподавление?

Нет. Шумоподавление меняет сам звук, пытаясь убрать помеху. VAD ничего не меняет: он только отвечает, есть ли на отрезке речь, и где её границы.

Почему в тексте пропала короткая реплика?

Чаще всего это ошибка VAD: очень тихое или очень короткое «да» на фоне шума не отличается от самого шума. Помогает одно — микрофон ближе к говорящим.

Влияет ли VAD на цену?

Да, в вашу пользу: тишина и шум не распознаются, поэтому запись, где половина времени — молчание, обходится дешевле, чем её длительность.

Как VAD работает в потоке?

Он определяет момент, когда фраза закончилась, и по этой границе отдаётся окончательный текст. Без него поток либо сыпал бы обрывками, либо ждал бы конца записи.

Ещё:диаризацияRTF — скоростьтаймкодысколько стоит