Кеш эмбеддингов (embedding cache)

Кеш эмбеддингов хранит уже вычисленные векторные представления, чтобы не платить за их повторную генерацию. Поскольку превращение текста в эмбеддинг стоит вызова API (деньги и задержка), а результат детерминирован для данного входа и модели, кеширование по хешу текста — простая и очень выгодная оптимизация. SaaS-разработчикам с RAG или семантическим поиском это важно в двух местах. На стороне загрузки повторная индексация набора документов не должна заново эмбеддить неизменившиеся фрагменты — кешируйте по хешу содержимого и пропускайте неизменные. На стороне запроса популярные или повторяющиеся поиски могут переиспользовать закешированный эмбеддинг запроса вместо обращения к модели каждый раз. На практике: ключ кеша обязан включать имя и версию модели, потому что эмбеддинги разных моделей несопоставимы — смена модели молча отравляет кеш, ключом которого был только текст. Задайте разумную политику вытеснения (LRU или TTL), чтобы он не рос бесконечно, и не забывайте инвалидировать кеш при переразбиении или переэмбеддинге. Сделанный правильно, кеш эмбеддингов снижает и счёт за модель, и задержку p95.

Похожие термины

Ещё термины: Данные и инфраструктура