[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-kv-cache::ru":3,"gloss-cluster-kv-cache::ru":26,"gloss-next-kv-cache::ru":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"kv-cache","core-ai","KV-кэш (KV Cache)","KV-кэш (кэш «ключ-значение») — это память, которую LLM использует во время генерации, чтобы не пересчитывать уже сделанную работу. Генерируя каждый новый токен, трансформер нуждается в ключах и значениях внимания всех предыдущих токенов; вместо того чтобы пересчитывать их на каждом шаге, он их кэширует. Именно поэтому генерация тысячного токена происходит быстро — но при этом объём памяти растёт линейно с длиной контекста, так что долгий диалог или большой документ могут занимать гигабайты памяти GPU только под кэш. Для SaaS-разработчиков KV-кэш объясняет сразу несколько реалий: почему длинный контекст стоит дороже и работает медленнее, почему функции «кэширования промпта» (сохраняющие KV-кэш для повторно используемого префикса) резко снижают задержку и цену на одинаковых системных промптах, и почему обслуживание множества одновременных пользователей с длинным контекстом упирается в память. Если счёт за инференс или задержка растут вместе с длиной контекста, причина обычно в KV-кэше — повторное использование кэшированных префиксов и обрезка контекста и есть главные доступные рычаги. Механически кэш держит проекционные векторы ключей и значений, которые каждый слой внимания уже вычислил для всех токенов последовательности, так что модель их больше не выводит заново: на каждом шаге свежими считаются только проекции самого нового токена. Занимаемый объём растёт одновременно и с длиной последовательности, и с размером батча — поэтому именно кэш, а не веса, обычно определяет, сколько параллельных запросов удержит одна GPU. Это ограничение доходит до прайс-листа напрямую: давление на кэш ограничивает число запросов на GPU у провайдера, а число запросов на GPU задаёт нижнюю границу цены за токен. На этом же держатся скидки на «кэшированный ввод», которые сейчас рекламируют несколько провайдеров. Стоит развести два заблуждения. Первое: KV-кэш по умолчанию не сохраняется между отдельными вызовами API — он живёт в памяти того сервера инференса, который обрабатывает активный или недавно активный контекст; именно поэтому межзапросное кэширование промпта должно быть явной функцией провайдера, а не чем-то, что случается само собой. Второе: больший кэш не делает модель умнее — это исключительно механизм эффективности, а не прирост способностей, так что «больше кэша» никогда не бывает ответом на проблему качества. На практике доступные вам рычаги скорее структурные, чем настроечные: ставьте стабильную часть промпта (системные инструкции, примеры, неизменный справочный документ) в начало, чтобы префиксный кэш провайдера попадал в неё, оставляйте изменчивую часть в конце и не дописывайте неограниченную историю диалога там, где хватит скользящего резюме. Серверные стеки управляют кэшем постранично, чтобы ограничить фрагментацию, — потому paged attention и continuous batching почти всегда обсуждают в паре. Не путайте кэш с контекстным окном: окно говорит, сколько модель способна увидеть за раз, а KV-кэш — это аппаратная цена переноса уже увиденного через всю генерацию.","KV-кэш хранит ключи и значения внимания предыдущих токенов, чтобы LLM не пересчитывала их заново — именно он делает длинный контекст доступным.",null,[11,14,17,20,23],{"slug":12,"name":13},"attention","Внимание (Attention)",{"slug":15,"name":16},"context-window","Контекстное окно",{"slug":18,"name":19},"inference","Инференс",{"slug":21,"name":22},"latency","Задержка (Latency)",{"slug":24,"name":25},"prompt-caching","Кэширование промптов",[27,31,35,39,40,43,46,49,52,55,56,59],{"slug":28,"category":5,"name":29,"updated_at":30},"agentic","Агентный AI (Agentic AI)","2026-08-24T02:46:36+00:00",{"slug":32,"category":5,"name":33,"updated_at":34},"alignment-tax","Налог на выравнивание (Alignment Tax)","2026-08-24T02:46:37+00:00",{"slug":36,"category":5,"name":37,"updated_at":38},"artificial-intelligence","Искусственный интеллект (ИИ)","2026-08-24T02:46:38+00:00",{"slug":12,"category":5,"name":13,"updated_at":30},{"slug":41,"category":5,"name":42,"updated_at":38},"beam-search","Лучевой поиск",{"slug":44,"category":5,"name":45,"updated_at":34},"benchmark-contamination","Загрязнение бенчмарка (Benchmark Contamination)",{"slug":47,"category":5,"name":48,"updated_at":34},"catastrophic-forgetting","Катастрофическое забывание (Catastrophic Forgetting)",{"slug":50,"category":5,"name":51,"updated_at":38},"computer-vision","Компьютерное зрение",{"slug":53,"category":5,"name":54,"updated_at":34},"constitutional-ai","Конституционный ИИ (Constitutional AI)",{"slug":15,"category":5,"name":16,"updated_at":30},{"slug":57,"category":5,"name":58,"updated_at":38},"deep-learning","Глубокое обучение",{"slug":60,"category":5,"name":61,"updated_at":30},"diffusion-model","Диффузионная модель (Diffusion Model)"]