output
Sözlük ↗Ses Sentezi (Voice Synthesis)
Ses sentezi, yapay zeka tarafından üretilen konuşma sesi için şemsiye terimdir; hem hazır, önceden oluşturulmuş bir ses kütüphanesi kullanan standart metinden konuşmaya hem de belirli bir bireyin sesinin eğitimli bir kopyasını kullanan ses klonlamayı kapsar — "TTS" teriminden ayıran fark, ses sentezinin genellikle daha geniş teknik yeteneği ve yaratıcı/anlatımsal kontrolünü (duygu, aksan, kahkaha veya iç çekme gibi sözel olmayan sesler) tanımlamak için kullanılması, yalnızca metin-girdi/ses-çıktı API mekaniğini değil. Gelişmiş ses sentezi sistemleri artık ince ayrıntılı duygusal yönlendirmeyi (SSML etiketleri veya "bunu heyecanla söyle" veya "bu satırı fısılda" gibi doğal dil stil komutları), tek bir istekte otomatik sıra alma ile çok konuşmacılı diyalog üretimini ve kahkaha, iç çekme veya tereddüt sesleri gibi konuşma dışı seslendirmeleri destekler; bunların hepsi birlikte, modern, anlatımsal bir ses sentezi ürününü, on yıl öncesinin metni yalnızca düz, kelime kelime, dramatik tempo hissi olmadan okuyabilen temel, monoton ekran-okuyucu tarzı bir TTS motorundan ayıran şeydir. SaaS geliştiricileri için neden önemli: ses sentezi, sesli kitap üretim araçlarının, oyunlar ve animasyon için yapay zeka seslendirmesinin, dinamik uygulama içi sesli bildirimlerin ve robotik yerine doğal ses çıkarması gereken etkileşimli sesli yanıt (IVR) sistemlerinin altındaki teknoloji katmanıdır. Bir ses sentezi sağlayıcısı seçen geliştiriciler, doğallık/MOS (ortalama görüş puanı) kıyaslamalarını, dil/aksan kapsamını, gecikmeyi (gerçek zamanlı konuşma ajanları için toplu içerik üretimine karşı kritik) ve sunulan hazır seslerin lisanslama koşullarını değerlendirir. Somut bir örnek — dinamik diyalog üreten etkileşimli kurgu oyunu: (1) oyunun anlatı motoru, oyuncu seçimlerine dayalı olarak çalışma zamanında dallanan diyalog metni üretir — bu, bir karakterin söylediği tam satırın önceden bilinemeyeceği ve dolayısıyla insan seslendirme sanatçıları tarafından önceden kaydedilemeyeceği anlamına gelir; (2) her satır, karaktere özgü bir `voice_id` ve sahne bağlamından çıkarılan bir duygu etiketiyle birlikte ses sentezi API'sine gönderilir, ör. `{"text": "Buraya gelmemeliydin.", "voice_id": "villain_02", "style": "tehditkar"}`; (3) API, karakterin ekrandaki ağız animasyonuyla senkronize olacak ve gecikmeli değil duyarlı görünecek kadar hızlı üretilmiş, saniyenin altında gecikmeyle ses akışı döndürür; (4) üretilen satırlar tam metin artı ses/stil kombinasyonuna göre önbelleğe alınır, böylece aynı diyalog dalına başka bir oyuncu tarafından tekrar ulaşılırsa, önbelleğe alınmış ses özdeş sesi yeniden üretip iki kez ödemek yerine anında çalar; (5) diyalog önceden senaryolaştırılmak yerine prosedürel olarak üretildiğinden, oyun bir stüdyonun normal bir üretim bütçesi ve zaman çizelgesi içinde makul biçimde manuel seslendirip kaydedebileceğinden çok daha fazla dallanan anlatı yolunu destekleyebilir.
İlgili terimler