mlops
Словарь ↗Обслуживание модели (Model Serving)
Обслуживание модели — это инфраструктурный слой, который ставит обученную модель за API, чтобы приложения могли запрашивать предсказания в реальном времени. Он берёт на себя загрузку весов в память, батчинг входящих запросов, автомасштабирование GPU и предоставление версионированных эндпоинтов. Если обучение — разовое событие, то обслуживание работает вечно, и именно здесь по-настоящему выигрываются или проигрываются задержка, стоимость и надёжность. Когда вы вызываете закрытую модель вроде Claude или GPT, обслуживанием занимается провайдер. Тема становится практической в тот момент, когда вы разворачиваете открытую модель сами: тут в ход идут движки вроде vLLM, Text Generation Inference или NVIDIA Triton либо управляемые платформы Modal, Replicate и Baseten. Батчинг запросов и квантизация резко снижают счёт за GPU на запрос. Практическая заметка: измеряйте хвостовую задержку и стоимость на тысячу запросов, а не только средние — один медленный процентиль способен погубить функцию реального времени, а простаивающие GPU тихо сжигают взлётную полосу стартапа.
Похожие термины