Распознавание речи (STT)

Распознавание речи (speech-to-text, STT), также называемое автоматическим распознаванием речи (ASR), преобразует произнесённое аудио в письменный текст. Современные системы STT (OpenAI Whisper, Google Speech-to-Text, AssemblyAI, Deepgram) используют сквозные нейросетевые архитектуры — обычно модели трансформер энкодер-декодер, — обученные на сотнях тысяч часов многоязычного аудио, достигая уровня ошибок в словах менее 5% для чистого студийного аудио на основных языках и держатся достаточно устойчиво против акцентов, фонового шума и перекрывающихся говорящих — существенный скачок в надёжности по сравнению с поколением ASR-систем до 2020 года, которым требовалось почти студийное качество аудио для надёжной работы. Почему это важно для создателей SaaS: STT — это точка входа для любого голосового продукта — инструменты транскрибации встреч (Otter.ai, Fireflies), приложения с голосовым управлением, аналитика колл-центров, генерация субтитров/подписей и поля голосового ввода текста. Это также критический шаг предобработки для голосовых ИИ-агентов, где STT преобразует речь звонящего в текст, LLM рассуждает над этим текстом, а TTS озвучивает ответ обратно — классический пайплайн голосового агента «STT → LLM → TTS». Интеграция обычно представляет собой единый вызов API: загружаете аудиофайл или стримите аудио в реальном времени и получаете транскрипт, часто с временными метками на уровне слов, диаризацией говорящих (кто что сказал) и оценками уверенности. Конкретный разобранный пример — построение функции SaaS «заметки со встречи»: (1) пользователь загружает 45-минутную запись Zoom (MP3), или приложение захватывает аудио вживую через бот-API Zoom/Meet для обработки в реальном времени; (2) приложение вызывает `POST https://api.deepgram.com/v1/listen?model=nova-2&diarize=true&punctuate=true` с аудиофайлом; (3) ответ возвращает JSON-транскрипт с сегментами по каждому говорящему, временными метками на уровне слов и оценками уверенности, например `{"speaker": 0, "start": 12.4, "confidence": 0.97, "text": "Давайте рассмотрим цели на 3 квартал."}`; (4) приложение подаёт полный транскрипт в LLM с промптом «Обобщи эту встречу в пункты действий, сгруппированные по ответственным, и отметь любые нерешённые вопросы»; (5) сводка, список пунктов действий и полный транскрипт с возможностью поиска показываются рядом, при этом каждый пункт действия глубоко ссылается на точную временную метку транскрипта, откуда он был извлечён, чтобы пользователь мог проверить контекст. Ключевые параметры: выбор языка/модели, диаризация (разделение говорящих — критично для звонков с несколькими участниками, но увеличивает время обработки и стоимость), потоковая передача в реальном времени против пакетной обработки, а также усиление кастомного словаря для улучшения точности распознавания отраслевого жаргона вроде названий продуктов или технических аббревиатур, которые модель общего назначения иначе бы неправильно распознала. Стоимость обычно выставляется за минуту обработанного аудио, поэтому высокообъёмные продукты часто предварительно фильтруют тишину с помощью детекции голосовой активности перед отправкой аудио в платный API STT.

Похожие термины

Ещё термины: Вывод и медиа