output
Sözlük ↗Vokal Ayrıştırma (Stem Separation)
Vokal ayrıştırma, ses mühendisliğinde daha geniş çapta stem ayrıştırma (stem separation) olarak bilinir; tek bir karışık ses parçasını, orijinal kayıt stüdyosunun miksaj ve mastering sürecinde birleştirilmiş bireysel bileşenlerine — tipik olarak vokaller, davullar, bas ve geri kalan her şeyi kapsayan bir "diğer" enstrümanlar kategorisine — geri ayrıştırmanın yapay zeka sürecidir; bu, on yıllardır kalıcı ve geri döndürülemez olduğu varsayılan bir süreci etkili biçimde tersine çevirir. Modern stem ayrıştırma modelleri (Spleeter, Demucs ve LALAL.AI ile Moises gibi tüketiciye yönelik araçların arkasındaki temel modeller), karışık parçaları bilinen, ayrı ayrı kaydedilmiş orijinal stem'leriyle eşleştiren büyük veri kümeleri üzerinde eğitilir; her kaynak için, karışık sesin frekans spektrumuna uygulandığında o kaynağı diğerlerini bastırarak ayrıştıran bir spektral maske tahmin etmeyi öğrenirler. Bu görev, on yıllarca geleneksel sinyal işleme teknikleriyle etkili biçimde imkânsız kabul edilmişti (iki ses kaynağı aynı anda aynı frekans aralığında örtüştüğünde ciddi şekilde zorlanıyordu ki bu, herhangi bir profesyonel şekilde miksajlanmış gerçek kaydın çoğunu tanımlar) ancak derin öğrenme, aynı örtüşen frekans bandını aynı anda paylaşan bir insan sesini bir elektro gitardan ayırt eden daha ince tınısal ve spektral imzaları öğrenebildiğinde uygulanabilir hale geldi; bu ayrım, basit bir frekans alanı filtresinden ziyade öğrenilmiş örüntü tanımayı gerektirir. SaaS geliştiricileri için neden önemli: vokal ayrıştırma, karaoke parça üreticilerini (herhangi bir şarkıdan vokalleri kaldırarak talep üzerine kullanılabilir bir enstrümantal altyapı parçası oluşturma), DJ ve remiks araçlarını (temiz bir acapella'yı izole etme veya yeni bir prodüksiyonda örneklemek için sadece davulları izole etme), müzik eğitimi platformlarını (bir öğrencinin gitar parçasını susturarak yalnızca davul ve basla pratik yapmasına izin verme) ve podcast veya video son prodüksiyon araçlarını (daha temiz, daha profesyonel bir kurgu için konuşulan diyaloğu dikkat dağıtıcı arka plan müziğinden veya ortam gürültüsünden ayırma) güçlendirir. Somut bir örnek — talep üzerine enstrümantal üreten bir karaoke uygulaması SaaS'ı: (1) kullanıcı bir şarkı arar ve uygulamanın önceden hazır lisanslı bir enstrümantal versiyonu yoktur; (2) platform, parçayı işlemek için uygun haklara sahipse, orijinal karışık sesi `stems=vocals,instrumental` isteyen bir stem ayrıştırma API'sinden geçirir; (3) API, bir dakikadan kısa sürede iki ayrı ses dosyası döndürür; (4) uygulama, "enstrümantal" stem'i karaoke altyapı parçası olarak sunar ve isteğe bağlı olarak eş zamanlı sözlerin vurgulanmasını otomatik oluşturmak için izole edilmiş "vokal" stem'inin zamanlamasını gösterebilir. Lisanslama burada baskın kısıtlamadır — stem ayrıştırma, altta yatan kompozisyon/master haklarının yeniden lisanslanmasını gerektirmez, bu yüzden prodüksiyon uygulamalarının yalnızca yapay zeka modelini çalıştırma izni değil, işlenen kaynak ses için net hak tasfiyesine ihtiyacı vardır.
İlgili terimler