output
Sözlük ↗Dijital İnsan
Dijital insan, kalıcı, etkileşimli, yapay zeka güdümlü bir avatardır — görsel bir varlığı (fotogerçekçi veya kasıtlı olarak stilize), gerçek zamanlı ses sentezini, dudak senkronizasyonunu ve bir konuşma yapay zeka akıl yürütme arka ucunu (tipik olarak belirli bir alan veya kişilik hakkında bilgi erişimli bağlamı olan bir LLM) birleştirir — önceden yazılmış, tek yönlü bir videoyu basitçe sunmak yerine bir kullanıcıyla canlı, iki yönlü konuşmalar yapmak üzere tasarlanmıştır. Bu, dijital insanı video için avatar üretimi ürünlerinden ayırır: avatar üretimi tipik olarak sabit bir senaryodan bitmiş, etkileşimli olmayan bir video varlığı üretirken, dijital insan canlı çalışır, bir konuşma ilerledikçe yanıtlarını, sesini ve yüz/dudak animasyonunu gerçek zamanlı olarak üretir — mimari olarak bu, sıkı gecikme bütçeleriyle orkestre edilen tam bir konuşmadan metne (kullanıcıyı duyma) → LLM akıl yürütme (ne söyleneceğine karar verme) → metinden sese (sesi üretme) → dudak senkronizasyonu/yüz animasyonu (yanıtı render etme) iş akışıdır; çünkü konuşma turları arasında 5+ saniye duraksayan bir konuşma partneri bozuk hissettirir. Soul Machines, NVIDIA'nın ACE'i ve D-ID'nin Agents'ı gibi platformlar, bu gerçek zamanlı iş akışını yerleştirilebilir bir widget veya SDK olarak paketler; zorlu gecikme orkestrasyon işini dahili olarak halleder, böylece bir ürün ekibi STT/LLM/TTS/animasyon iş akışını ve ilgili altyapısını bağımsız olarak inşa etmeden ve ayarlamadan çalışan bir konuşma avatarı ekleyebilir. SaaS geliştiricileri için neden önemli: dijital insanlar, müşteri hizmetleri (metin sohbet botuna görsel, konuşmaya dayalı bir alternatif), e-ticaret sitelerinde sanal satış/marka elçileri ve etkileşimli eğitim simülasyonları (yapay zeka güdümlü bir "müşteri" veya "hasta" kişiliğiyle zor bir konuşmayı pratik etme) için ortaya çıkan arayüz katmanıdır. Mühendislik zorluğu, gerçek zamanlı, düşük gecikmeli, çoklu model orkestrasyon gereksinimi nedeniyle bu sözlükte başka yerlerde ele alınan tek bir çıktı türünden önemli ölçüde daha zordur — çoğu geliştirici, canlı bir ürün için STT/LLM/TTS/dudak senkronizasyonu iş akışını kendileri bir araya getirmek yerine bir satıcının tam dijital insan SDK'sını entegre eder. Somut bir örnek — "sanal stilist" ekleyen bir perakende SaaS'ı: (1) bir alışverişçi sitenin sohbet widget'ını açar ve yalnızca metin tabanlı bir bot yerine bir dijital insan avatarı yüklenir; (2) alışverişçi konuşur (veya yazar) "Yaz düğünü için bir kombine ihtiyacım var"; (3) STT (sesliyse) sorguyu metne dönüştürür, bu da mağazanın ürün kataloğuyla birlikte bir LLM'e erişim bağlamı olarak gönderilir; (4) LLM'in metin yanıtı düşük gecikmeli bir TTS motoruna akarken aynı zamanda avatarın dudak senkronizasyonunu ve ifadesini gerçek zamanlı olarak yönlendirir, böylece avatar sorgudan yaklaşık 1-2 saniye içinde ürün önerilerini görünür şekilde "konuşur".
İlgili terimler