[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-semantic-caching::ru":3,"gloss-cluster-semantic-caching::ru":23,"gloss-next-semantic-caching::ru":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"semantic-caching","core-ai","Семантическое кэширование","Семантическое кэширование — это стратегия кэширования для LLM-приложений, которая решает, отдавать ли сохранённый ответ, сравнивая смысл входящего запроса с предыдущими, а не сопоставляя строку запроса символ в символ. Обычный кэш строится на хэше входа: изменился один символ — промах. Семантический кэш вычисляет эмбеддинг входящего запроса, ищет по векторному индексу ранее отвеченных запросов и возвращает закэшированный ответ, если ближайший сосед оказался выше настроенного порога схожести. Мотивация в том, что запросы на естественном языке постоянно повторяются по смыслу и почти никогда — по форме: «как отменить тариф», «где отменить подписку» и «прекратите списания» для кэша с точным совпадением это три промаха, а для семантического — одно попадание. Поскольку закэшированный ответ не стоит ничего в генерации, доля попаданий напрямую превращается в снижение расходов на инференс и в ответ, который возвращается за время поиска, а не за время генерации. У этой схемы есть три параметра, которые важнее выбора векторного хранилища: порог схожести, охват ключа кэша и политика вытеснения. Порог — самый опасный. Слишком высокий — кэш почти не срабатывает и добавляет задержку и инфраструктуру без пользы; слишком низкий — семантически разные вопросы склеиваются: «можно вернуть деньги» и «можно получить скидку» близки в пространстве эмбеддингов, а правильные ответы у них разные. Охват важен потому, что ответ переиспользуем только для запросов с тем же контекстом: кэш, ключом которого является один лишь вопрос пользователя, с удовольствием отдаст ответ одного арендатора другому или вернёт устаревший ответ, который был верен для версии документа, уже заменённой. На практике в ключ следует включать арендатора, локаль, модель, версию промпта и версии извлечённых документов, чтобы изменение любого из них давало промах, а не неверное попадание. Вытеснение обычно делают по времени, потому что знание под ответом меняется даже тогда, когда вопрос не меняется. Для SaaS-разработчиков честная формулировка такова: семантическое кэширование — это оптимизация стоимости и задержки с приложенной к ней ценой в виде риска для корректности, и её место на поверхностях с высоким объёмом и низкой вариативностью — отклонение обращений в поддержку, ответы на типовые вопросы, повторяющиеся внутренние справки, — а не на чём-либо персонализированном или транзакционном. Практическое замечание: логируйте каждое попадание вместе с его оценкой схожести и ответом, который оно вытеснило, и выборочно просматривайте эти записи. Без такого журнала слишком мягкий порог проявляется как медленный дрейф качества ответов, о котором не сообщит ни один показатель ошибок.","Семантическое кэширование возвращает сохранённый ответ LLM, когда новый запрос достаточно близок в пространстве эмбеддингов, без точного совпадения строк.",null,[11,14,17,20],{"slug":12,"name":13},"cosine-similarity","Косинусное сходство (Cosine Similarity)",{"slug":15,"name":16},"embedding-cache","Кеш эмбеддингов (embedding cache)",{"slug":18,"name":19},"prompt-caching","Кэширование промптов",{"slug":21,"name":22},"semantic-search","Семантический поиск (Semantic Search)",[24,28,32,36,39,42,45,48,51,54,57,60],{"slug":25,"category":5,"name":26,"updated_at":27},"agentic","Агентный AI (Agentic AI)","2026-08-24T02:46:36+00:00",{"slug":29,"category":5,"name":30,"updated_at":31},"alignment-tax","Налог на выравнивание (Alignment Tax)","2026-08-24T02:46:37+00:00",{"slug":33,"category":5,"name":34,"updated_at":35},"artificial-intelligence","Искусственный интеллект (ИИ)","2026-08-24T02:46:38+00:00",{"slug":37,"category":5,"name":38,"updated_at":27},"attention","Внимание (Attention)",{"slug":40,"category":5,"name":41,"updated_at":35},"beam-search","Лучевой поиск",{"slug":43,"category":5,"name":44,"updated_at":31},"benchmark-contamination","Загрязнение бенчмарка (Benchmark Contamination)",{"slug":46,"category":5,"name":47,"updated_at":31},"catastrophic-forgetting","Катастрофическое забывание (Catastrophic Forgetting)",{"slug":49,"category":5,"name":50,"updated_at":35},"computer-vision","Компьютерное зрение",{"slug":52,"category":5,"name":53,"updated_at":31},"constitutional-ai","Конституционный ИИ (Constitutional AI)",{"slug":55,"category":5,"name":56,"updated_at":27},"context-window","Контекстное окно",{"slug":58,"category":5,"name":59,"updated_at":35},"deep-learning","Глубокое обучение",{"slug":61,"category":5,"name":62,"updated_at":27},"diffusion-model","Диффузионная модель (Diffusion Model)"]