Изоляция голоса (шумоподавление)

ИИ-шумоподавление (также называемое изоляцией голоса или аудио-денойзингом) — это удаление нежелательного фонового шума — проезжающего транспорта, порывов ветра, стука клавиатуры, эха помещения, разговоров других людей на фоне, дребезжащего кондиционера — из аудиозаписи в реальном времени или постфактум, при сохранении чёткости и естественности голоса основного говорящего, в реальном времени или путём последующей обработки; это отличается от разделения вокала/стем-сепарации (которая разбивает музыкальный микс на группы инструментов) тем, что шумоподавление конкретно связано с очисткой речи, записанной в неидеальных реальных условиях, а не с разделением музыкальных слоёв. Нейронные модели шумоподавления (Krisp, NVIDIA RTX Voice/Broadcast и встроенное шумоподавление в Zoom/Google Meet/Discord) обучаются на парных датасетах чистой речи/зашумлённой речи, обучаясь предсказывать и вычитать шумовой компонент из смешанного аудиосигнала, часто в реальном времени с добавлением всего нескольких миллисекунд задержки обработки, и современные версии справляются даже с нестационарным, непредсказуемым шумом (лай собаки, проезжающая сирена, внезапный хлопок двери, упавший предмет) значительно лучше старых техник спектрального вычитания DSP, которые в основном работали для постоянного, предсказуемого фонового гула (шум вентилятора или системы вентиляции) и сильно страдали с чем-либо переходным, внезапным или нерегулярным по своей природе. Почему это важно для SaaS-разработчиков: шумоподавление — необходимая, в значительной степени невидимая инфраструктура для любого голосового SaaS-продукта, где пользователи записывают или звонят из неконтролируемых сред — инструменты видеоконференций, приложения для голосовых заметок и транскрибации, удалённые колл-центры поддержки клиентов и программное обеспечение для записи подкастов — всем им это нужно, как для непосредственного улучшения опыта конечного пользователя в реальном времени (собеседник слышит более чистый голос), так и для улучшения точности последующей обработки ИИ, поскольку модели STT/транскрибации работают заметно хуже на зашумлённом входе, поэтому очистка аудио перед транскрибацией — распространённый этап предобработки, повышающий точность. Конкретный пример — SaaS для транскрибации удалённых рабочих встреч улучшает точность: (1) продукт заметил, что точность транскрибации резко падает для пользователей, подключающихся к звонкам из шумной домашней обстановки (лающие собаки, транспорт, дети); (2) команда добавила этап шумоподавления в конвейер приёма аудио, пропуская каждый входящий аудиопоток через модель денойзинга перед тем, как он достигнет API STT; (3) частота словесных ошибок на зашумлённых реальных звонках заметно снизилась после изменения, что было измерено на отложенной выборке пользовательских звонков с известными эталонными транскриптами; (4) подавление применяется только к копии аудио, предназначенной для STT — оригинальное необработанное аудио сохраняется отдельно для воспроизведения, поскольку агрессивное шумоподавление иногда может вносить собственные тонкие аудиоартефакты, которые пользователь может не захотеть иметь в архивной записи.

Похожие термины

Ещё термины: Вывод и медиа