data-infra
Sözlük ↗Toplu İşleme (Batch Processing)
Toplu işleme (batch processing), büyük hacimli işin bir grup ("toplu iş/batch") olarak birlikte toplanıp işlendiği bir hesaplama desenidir; tipik olarak bir programa göre (gece boyunca, saatlik) veya bir eşik değere ulaşıldığında, her istek geldikçe öğe öğe hemen işlenmesi (alternatif desen olan gerçek zamanlı veya akış işleme) yerine. AI/SaaS kurucuları için neden önemli: toplu işleme, özellikle AI altyapısında mevcut en etkili ve az kullanılan maliyet düşürme kollarından biridir, çünkü başlıca LLM sağlayıcıları (OpenAI, Anthropic, Google), gerçek zamanlı yanıt garantilerinden vazgeçmek karşılığında, istekleri 24 saatlik bir pencere içinde önemli bir indirimle - genellikle standart fiyatlandırmanın %50 altında - işleyen özel toplu API'ler sunar. Anında bir yanıta ihtiyaç duymayan herhangi bir AI iş yükü için (bir doküman birikimi için embedding üretme, bir haftalık destek taleplerini sınıflandırma, bir prompt iyileştirmesinden sonra bir ürün kataloğunu yeniden puanlama, bir modele karşı değerlendirme paketleri çalıştırma), işi standart senkron API yerine bir toplu API üzerinden yönlendirmek neredeyse bedava bir maliyet kesintisidir. Nasıl çalışır: bir toplu iş, tipik olarak birçok bağımsız isteği aynı anda tanımlayan bir dosya olarak gönderilir (genellikle JSONL - satır başına bir JSON istek nesnesi); sağlayıcı bunları asenkron olarak işler, genellikle 24 saat içinde iyice tamamlar (çoğu zaman çok daha hızlı) ve her isteği yanıtına eşleyen bir sonuç dosyası döndürür. Bu, veri boru hattı mimarisine doğal olarak eşlenir - bir ETL boru hattının "dönüştürme" veya "yükleme" aşaması sıklıkla kendisi bir toplu iş olarak uygulanır. Gerçek zamanlı işlemeye karşı ödünleşim gecikmedir (toplu işler milisaniyeler yerine dakikalar ile saatler içinde tamamlanır) ve geri bildirimin anındalığıdır (hatalar tüm toplu iş çalıştıktan sonra ortaya çıkar, istek başına değil) - bu yüzden toplu işleme, özellikle bir iş yükü toplu, acil olmayan ve maliyet duyarlı olduğunda doğru seçimdir - ve bir kullanıcının açık bir tarayıcı sekmesinde aktif olarak beklediği herhangi bir şey için yanlış seçimdir. Somut örnek: bir içerik pazarlaması SaaS'ının, yeni bir AI özelliği ekledikten sonra müşterilerinin CMS'lerindeki 40.000 mevcut blog yazısı için SEO meta açıklamaları üretmesi gerekiyor. 40.000 yazının tümü için standart senkron LLM API'sini çağırmak hem yavaş (hız sınırlı, birer birer) hem de tam fiyattan pahalı olurdu. Bunun yerine, ekip yazı başına bir meta-açıklama-üretme isteği içeren bir JSONL dosyası yazar, bunu LLM sağlayıcısının toplu API'sine gönderir ve 6 saat sonra bir sonuç dosyası indirir, her üretilen açıklamayı ilgili CMS kaydına geri yazan bir boru hattı işi çalıştırır - senkron alternatifin API maliyetinin kabaca yarısında ve canlı ürünün gerçek zamanlı özelliklerinin ihtiyaç duyduğu aynı hız sınırları için rekabet etmeden.
İlgili terimler