VAD
VAD (Voice Activity Detection) — определение участков записи, где есть речь. Он находит границы фраз, отбрасывает тишину и шум и режет длинную запись на куски по паузам, а не по таймеру.
Зачем он нужен
Модель распознавания не умеет читать двухчасовой файл целиком: у неё есть предел длины отрезка. Поэтому запись сначала делится на фрагменты — и делить её надо не по таймеру, а по паузам, иначе слово разрежется пополам и не распознается ни в одной из половин. Границы для нарезки и находит VAD.
- Нарезка длинной записи по паузам, а не по минутам.
- Отбрасывание участков без речи: тишина, шум кондиционера, стук по столу.
- Подготовка отрезков для разделения по голосам — считать голосовой отпечаток по тишине бессмысленно.
- В потоковом режиме — определение конца фразы, чтобы отдать готовый текст, а не ждать вечно.
Что бывает, когда он ошибается
- Пропущенная тихая речь: сказанное шёпотом на дальнем конце стола принято за тишину — фраза в тексте отсутствует целиком.
- Шум, принятый за речь: кашель, скрип двери и музыка попадают в распознавание и превращаются в случайные слова.
- Слишком ранняя граница: фраза обрезана на полуслове, и последнее слово теряется.
- Слишком поздняя: в один отрезок попадают два говорящих, и разделение по голосам на нём смазывается.
Почему в расшифровке нет пауз и шумов
Это следствие работы VAD, а не «умной чистки текста»: участки без речи в распознавание просто не попадают. Отсюда и полезный побочный эффект — платить за час записи, в котором говорят десять минут, приходится по факту распознанного, а не по длительности файла.
Вопросы
Нет. Шумоподавление меняет сам звук, пытаясь убрать помеху. VAD ничего не меняет: он только отвечает, есть ли на отрезке речь, и где её границы.
Чаще всего это ошибка VAD: очень тихое или очень короткое «да» на фоне шума не отличается от самого шума. Помогает одно — микрофон ближе к говорящим.
Да, в вашу пользу: тишина и шум не распознаются, поэтому запись, где половина времени — молчание, обходится дешевле, чем её длительность.
Он определяет момент, когда фраза закончилась, и по этой границе отдаётся окончательный текст. Без него поток либо сыпал бы обрывками, либо ждал бы конца записи.