Идентификация по голосу

Идентификация по голосу — сравнение голоса с уже известными, чтобы назвать человека по имени. В расшифровке она нужна, чтобы вместо «Спикер 2» стояло имя участника; для управления доступом голос не годится.

Две разные задачи под одним словом

Идентификацией по голосу называют и вход в банк по фразе, и подстановку имени в расшифровке. Технически основа общая — числовое описание голоса, — но требования противоположны, и путать их нельзя.

  • Биометрия для доступа: цена ошибки — чужой в вашем кабинете. Порог ставится очень высоко, отказ надёжнее ошибочного допуска, нужна защита от записи и подделки голоса.
  • Узнавание участника записи: цена ошибки — неверное имя в реплике, которое человек поправит одним нажатием. Здесь важнее не пропускать своих, чем никогда не ошибаться.
  • Наш сервис делает второе. Голос организации — это справочник участников, а не пропускная система, и доступом он не управляет.

Как работает узнавание

Из речи человека считается вектор — числовое описание голоса, не зависящее от произносимых слов. Он сравнивается с эталонами справочника по близости; чем ближе, тем вероятнее, что это тот же человек. Само сравнение делается не одним порогом, а двумя.

  • Высокая близость — имя подставляется сразу, без вопросов.
  • Средняя — имя предлагается подсказкой: подтверждает человек.
  • Низкая — говорящий считается новым, и его можно назвать вручную.
  • Один порог здесь не годится: высокий не узнаёт почти никого, низкий подставляет чужие имена — а это хуже, чем «Спикер 2».

Что портит узнавание

  • Простуда и осипший голос — самая частая причина, по которой знакомый человек считается новым.
  • Смена канала: тот же человек со студийного микрофона и из телефонной трубки звучит по-разному.
  • Мало речи: на нескольких секундах эталон получается ненадёжным.
  • Близкие тембры: у родственников и просто похожих коллег ошибки случаются чаще всего.

Как это выглядит в работе

В первой записи вы называете говорящих; их голоса запоминаются на организацию. Во второй записи с теми же людьми имена подставляются сами. Имя хранится отдельно от текста и подставляется при чтении — поэтому исправление имени обновляет все прошлые расшифровки, а не требует правки сотен реплик.

Вопросы

Это то же самое, что диаризация?

Нет. Диаризация делит запись на говорящих, не зная, кто они. Идентификация сравнивает голос со знакомыми и называет человека. Первое работает всегда, второе — только если голос уже известен сервису.

Можно ли войти в сервис голосом?

Нет, и это осознанно: голос — не пароль. Он записывается на диктофон и воспроизводится, поэтому доступом у нас управляет вход через Яндекс ID и ключи организации.

Где хранятся голосовые эталоны?

В справочнике вашей организации. Это числовые описания голоса, а не сама запись: восстановить из них звук нельзя. Участника можно удалить вместе с эталонами.

Сервис узнает человека из другой организации?

Нет. Справочник голосов принадлежит организации, между организациями голоса не сравниваются.

Сколько записей нужно, чтобы человек стал узнаваемым?

Обычно достаточно одной, где он говорит хотя бы несколько фраз. Каждая следующая запись с подтверждённым именем делает узнавание надёжнее.

Ещё:диаризациярасшифровка интервьюсовещание в текстсколько стоит