data-infra
Словарь ↗Семантический кэш
Семантический кэш хранит прежние ответы модели и отдаёт один из них, когда новый запрос значит то же, что старый. В отличие от обычного кэша он не сравнивает строки: входящий запрос превращается в эмбеддинг, и рядом в векторном пространстве ищется сохранённый. К нему тянутся из-за экономики. Ассистенты поддержки и документации видят одни и те же двадцать вопросов в сотне формулировок, поэтому кэш, понимающий перефразирование, заметно снижает и расходы, и p95-задержку: попадание в кэш — это чтение, а не генерация. Риск зеркальный: два вопроса могут быть близки в пространстве эмбеддингов и различаться в том, что важно. «Могу ли я отменить подписку?» и «Могу ли я отменить подписку и вернуть деньги?» лежат рядом, а ответы у них разные. Подбирайте порог близости по реальному трафику, а не по интуиции, и держите его консервативным для всего, что касается денег, прав доступа и юридических формулировок. Вторая половина задачи — инвалидация. Ответы, опирающиеся на документы, должны истекать вместе с изменением этих документов, иначе кэш будет уверенно отдавать прошлогодние цены.
Похожие термины