Обнаружение голосовой активности

Обнаружение голосовой активности (VAD, Voice Activity Detection) — это классификационная модель, определяющая, какие сегменты аудиопотока содержат человеческую речь, а какие — тишину, фоновый шум или неречевой звук, обычно работающая как лёгкий, малозадержечный этап предобработки, а не как самостоятельный вывод, обращённый к конечному пользователю — её задача заключается в том, чтобы точно сообщить нижестоящему конвейеру, когда речь начинается и заканчивается. Современный VAD (Silero VAD, WebRTC VAD и логика определения границ, встроенная в большинство SDK для STT/голосовых агентов) использует небольшой, быстрый нейронный классификатор, работающий на коротких аудиокадрах (часто окнами по 10-30 мс), чтобы выдавать бинарный или вероятностный сигнал речь/не-речь в реальном времени, достаточно дешёвый для непрерывной работы на мобильном устройстве или встроенной системе без заметного расхода батареи или добавленной задержки, что важно, поскольку VAD обычно работает как всегда включённый, непрерывно слушающий фоновый процесс, а не как редкий, вызываемый по требованию API-запрос, инициируемый нажатием кнопки. Почему это важно для SaaS-разработчиков: VAD — это невидимая, непримечательная инфраструктура, которая тем не менее определяет воспринимаемое качество почти каждого голосового продукта — голосовому ИИ-агенту нужен точный VAD, чтобы знать, когда пользователь закончил говорить и настала очередь агента отвечать («определение границ реплики»), без чего агент либо перебивает пользователя на середине фразы (VAD срабатывает слишком рано), либо оставляет неловкую, дорогостоящую тишину в ожидании дополнительного аудио, которого не будет (VAD срабатывает слишком поздно); инструменты транскрибации и записи встреч используют VAD для обрезки тишины и экономии на затратах API STT (многие провайдеры выставляют счёт за секунду обработанного аудио, поэтому удаление тихих промежутков перед отправкой аудио в API STT напрямую снижает стоимость); а колл-центры/системы IVR используют VAD для определения, когда звонящий перестал говорить, чтобы продвинуть сценарный поток. Конкретный пример — логика определения очереди реплик в голосовом ИИ-агенте: (1) пока пользователь говорит в живом звонке с голосовым агентом, модель VAD непрерывно работает на входящем аудиопотоке, кадр за кадром; (2) как только VAD обнаруживает 700 мс непрерывной тишины после обнаруженной речи, конвейер трактует это как конец реплики пользователя и передаёт буферизованное аудио модели STT для транскрибации; (3) полученный текст отправляется в LLM для формирования ответа, который озвучивается через TTS; (4) настройка порога тишины — это реальное продуктовое решение: слишком короткий — и агент обрывает пользователей, которые делают паузу посреди мысли, слишком длинный — и разговор ощущается вялым, поэтому многие продакшен-системы делают его адаптивным на основе наблюдаемого темпа речи пользователя.

Похожие термины

Ещё термины: Вывод и медиа