Кэширование промптов

Кэширование промптов — это функция API, предлагаемая Anthropic, OpenAI и другими провайдерами, которая позволяет обработать один раз и закэшировать на стороне сервера статичную, повторяющуюся часть промпта (длинный системный промпт, справочные документы, few-shot примеры или определения инструментов), так что последующие вызовы API, повторно использующие идентичный префикс, полностью пропускают повторную обработку этой части — резко снижая как стоимость (закэшированные входные токены тарифицируются с крутой скидкой, часто на 90% дешевле), так и задержку (пропуск вычислений по закэшированному префиксу ускоряет время до первого токена) для любого приложения, которое многократно отправляет большие объёмы неизменяемого контекста. Это напрямую решает один из крупнейших скрытых центров затрат в продакшен-приложениях на LLM: многие реальные промпты состоят из большой стабильной части (системные инструкции, выдержка из базы знаний, обширный набор few-shot примеров, определения инструментов/функций) плюс небольшой переменной части (собственно сообщение пользователя), и без кэширования вся стабильная часть полностью повторно обрабатывается и тарифицируется при каждом отдельном вызове, даже если она не изменилась. Например, реализация Anthropic позволяет разработчикам помечать конкретные точки разрыва промпта как кэшируемые, при этом кэш сохраняется в течение короткого окна (как правило, около 5 минут, обновляясь при каждом использовании, некоторые провайдеры предлагают варианты кэша с более длительным сроком по другой цене) — это означает, что сессия чата или всплеск связанных вызовов API в течение этого окна получает существенную выгоду, тогда как для по-настоящему новых сессий преимущества кэша сбрасываются после истечения окна. Для разработчиков SaaS кэширование промптов — одна из оптимизаций с самой высокой отдачей и наименьшими усилиями, доступных, как только ИИ-функция получает реальный продакшен-трафик: обычно требуется лишь реструктурировать промпт так, чтобы статичная часть шла первой и была явно помечена как кэшируемая, без изменения содержимого промпта или поведения модели, что делает это почти «бесплатным» выигрышем по стоимости и задержке по сравнению со сжатием (которое требует реального укорачивания контента и рискует потерей информации) или понижением модели (которое рискует потерей точности). Разобранный пример: SaaS-инструмент для анализа юридических документов отправляет системный промпт на 12 000 токенов (детальная рубрика юридического анализа плюс 8 few-shot примеров) с каждым запросом на рецензирование документа и обрабатывает примерно 3000 документов в день. Без кэширования этот префикс на 12 000 токенов полностью тарифицируется и повторно обрабатывается 3000 раз в день. При включённом кэшировании промптов и статичной рубрике/примерах, помеченных как кэшируемый префикс, только первый запрос в каждом окне кэша платит полную цену за этот префикс — последующие запросы в течение окна кэша вместо этого платят по крутой скидке за чтение из кэша, — сокращая ежедневные затраты команды на входные токены более чем вдвое без каких-либо изменений в фактическом качестве анализа, поскольку закэшированный контент побайтово идентичен тому, что всё равно было бы повторно обработано.

Похожие термины

Ещё термины: Промпт-инжиниринг