Model Sunumu (Model Serving)

Model sunumu, eğitilmiş bir modeli bir API arkasına koyarak uygulamaların gerçek zamanlı tahmin istemesini sağlayan altyapı katmanıdır. Ağırlıkları belleğe yüklemeyi, gelen istekleri gruplamayı (batching), GPU'ları otomatik ölçeklemeyi ve sürümlenmiş uç noktalar sunmayı üstlenir. Eğitim tek seferlik bir olaysa, sunum sonsuza dek çalışan kısımdır — ve gecikme, maliyet ile güvenilirliğin gerçekten kazanıldığı ya da kaybedildiği yer burasıdır. Claude ya da GPT gibi kapalı bir modeli çağırdığınızda sunumu sizin yerinize sağlayıcı halleder. Konu, açık ağırlıklı bir modeli kendiniz barındırdığınız anda uygulamalı hâle gelir; burada vLLM, Text Generation Inference ya da NVIDIA Triton gibi motorlara veya Modal, Replicate ve Baseten gibi yönetilen platformlara başvurursunuz. İstek gruplama ve niceleme (quantization) gibi teknikler istek başına GPU faturasını çarpıcı biçimde düşürür. Pratik not: yalnızca ortalamaları değil kuyruk gecikmesini ve bin istek başına maliyeti ölçün — tek bir yavaş yüzdelik, gerçek zamanlı bir özelliği mahvedebilir ve boşta duran GPU'lar bir girişimin nakit süresini sessizce eritir.

İlgili terimler

Daha fazla MLOps Süreçleri terimi