output
Sözlük ↗Sesten Metne (STT)
Sesten metne (speech-to-text, STT), otomatik konuşma tanıma (ASR) olarak da adlandırılır, konuşulan sesi yazılı metne dönüştürür. Modern STT sistemleri (OpenAI Whisper, Google Speech-to-Text, AssemblyAI, Deepgram), tipik olarak transformer kodlayıcı-kod çözücü modelleri olan uçtan uca sinirsel mimariler kullanır; yüzbinlerce saatlik çok dilli ses üzerinde eğitilmiştir; büyük dillerde net stüdyo sesi için %5'in altında kelime hata oranlarına ulaşır ve aksanlar, arka plan gürültüsü ve örtüşen konuşmacılara karşı makul ölçüde dayanıklıdır — güvenilir çalışmak için neredeyse stüdyo kalitesinde ses gerektiren 2020 öncesi nesil ASR sistemlerine kıyasla dayanıklılıkta önemli bir sıçrama. SaaS geliştiricileri için neden önemli: STT, ses odaklı herhangi bir ürünün giriş noktasıdır — toplantı transkripsiyon araçları (Otter.ai, Fireflies), sesle kontrol edilen uygulamalar, çağrı merkezi analitiği, altyazı/başlık oluşturma ve sesten metne giriş alanları. Ayrıca, STT'nin arayanın konuşmasını metne dönüştürdüğü, bir LLM'in bu metin üzerinde akıl yürüttüğü ve TTS'nin yanıtı geri konuştuğu — klasik "STT → LLM → TTS" sesli ajan boru hattı — ses yapay zeka ajanları için kritik bir ön işleme adımıdır. Entegrasyon tipik olarak tek bir API çağrısıdır: bir ses dosyası yükleyin veya sesi gerçek zamanlı olarak akıtın ve genellikle kelime düzeyinde zaman damgaları, konuşmacı ayrımı (diarization — kimin ne söylediği) ve güven puanlarıyla bir transkript alın. Somut bir uygulamalı örnek — bir "toplantı notları" SaaS özelliği inşa etmek: (1) kullanıcı 45 dakikalık bir Zoom kaydı (MP3) yükler veya uygulama, gerçek zamanlı işleme için Zoom/Meet bot API'si aracılığıyla sesi canlı olarak yakalar; (2) uygulama, ses dosyasıyla `POST https://api.deepgram.com/v1/listen?model=nova-2&diarize=true&punctuate=true`i çağırır; (3) yanıt, konuşmacı başına segmentler, kelime düzeyinde zaman damgaları ve güven puanları içeren bir JSON transkripti döndürür, örneğin `{"speaker": 0, "start": 12.4, "confidence": 0.97, "text": "Q3 hedeflerini gözden geçirelim."}`; (4) uygulama, tam transkripti "Bu toplantıyı sahibe göre gruplandırılmış eylem maddelerine özetle ve çözülmemiş soruları işaretle" istemiyle bir LLM'e besler; (5) özet, eylem maddesi listesi ve tam aranabilir transkript yan yana gösterilir; her eylem maddesi, kullanıcının bağlamı doğrulayabilmesi için çıkarıldığı tam transkript zaman damgasına derin bağlantı verir. Temel parametreler: dil/model seçimi, konuşmacı ayrımı (diarization — çok kişili çağrılar için kritik ama işleme süresi ve maliyeti artırır), gerçek zamanlı akış ile toplu işleme ve genel amaçlı bir modelin aksi takdirde yanlış duyacağı ürün adları veya teknik kısaltmalar gibi alana özgü jargonda tanıma doğruluğunu iyileştirmek için özel kelime dağarcığı güçlendirmesi. Maliyet tipik olarak işlenen ses dakikası başına faturalandırılır, bu nedenle yüksek hacimli ürünler genellikle ücretli STT API'sine ses göndermeden önce ses etkinliği tespiti kullanarak sessizliği önceden filtreler.
İlgili terimler