Идентификация по голосу
Идентификация по голосу — сравнение голоса с уже известными, чтобы назвать человека по имени. В расшифровке она нужна, чтобы вместо «Спикер 2» стояло имя участника; для управления доступом голос не годится.
Две разные задачи под одним словом
Идентификацией по голосу называют и вход в банк по фразе, и подстановку имени в расшифровке. Технически основа общая — числовое описание голоса, — но требования противоположны, и путать их нельзя.
- Биометрия для доступа: цена ошибки — чужой в вашем кабинете. Порог ставится очень высоко, отказ надёжнее ошибочного допуска, нужна защита от записи и подделки голоса.
- Узнавание участника записи: цена ошибки — неверное имя в реплике, которое человек поправит одним нажатием. Здесь важнее не пропускать своих, чем никогда не ошибаться.
- Наш сервис делает второе. Голос организации — это справочник участников, а не пропускная система, и доступом он не управляет.
Как работает узнавание
Из речи человека считается вектор — числовое описание голоса, не зависящее от произносимых слов. Он сравнивается с эталонами справочника по близости; чем ближе, тем вероятнее, что это тот же человек. Само сравнение делается не одним порогом, а двумя.
- Высокая близость — имя подставляется сразу, без вопросов.
- Средняя — имя предлагается подсказкой: подтверждает человек.
- Низкая — говорящий считается новым, и его можно назвать вручную.
- Один порог здесь не годится: высокий не узнаёт почти никого, низкий подставляет чужие имена — а это хуже, чем «Спикер 2».
Что портит узнавание
- Простуда и осипший голос — самая частая причина, по которой знакомый человек считается новым.
- Смена канала: тот же человек со студийного микрофона и из телефонной трубки звучит по-разному.
- Мало речи: на нескольких секундах эталон получается ненадёжным.
- Близкие тембры: у родственников и просто похожих коллег ошибки случаются чаще всего.
Как это выглядит в работе
В первой записи вы называете говорящих; их голоса запоминаются на организацию. Во второй записи с теми же людьми имена подставляются сами. Имя хранится отдельно от текста и подставляется при чтении — поэтому исправление имени обновляет все прошлые расшифровки, а не требует правки сотен реплик.
Вопросы
Нет. Диаризация делит запись на говорящих, не зная, кто они. Идентификация сравнивает голос со знакомыми и называет человека. Первое работает всегда, второе — только если голос уже известен сервису.
Нет, и это осознанно: голос — не пароль. Он записывается на диктофон и воспроизводится, поэтому доступом у нас управляет вход через Яндекс ID и ключи организации.
В справочнике вашей организации. Это числовые описания голоса, а не сама запись: восстановить из них звук нельзя. Участника можно удалить вместе с эталонами.
Нет. Справочник голосов принадлежит организации, между организациями голоса не сравниваются.
Обычно достаточно одной, где он говорит хотя бы несколько фраз. Каждая следующая запись с подтверждённым именем делает узнавание надёжнее.