[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-retrieval-evaluation::ru":3,"gloss-cluster-retrieval-evaluation::ru":26,"gloss-next-retrieval-evaluation::ru":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"retrieval-evaluation","mlops","Оценка качества поиска","Оценка качества поиска — это практика измерения стадии извлечения в RAG-системе по её собственным критериям: вернулись ли нужные фрагменты и оказались ли они близко к верху выдачи, — отдельно от оценки ответа, который модель затем написала. В этом разделении весь смысл. Когда RAG-приложение даёт неверный ответ, причины бывают двух совершенно разных типов: нужная информация вообще не была извлечена, либо она была извлечена, а модель её проигнорировала или неверно прочитала. Исправления у них противоположные, а сквозная оценка ответа их различить не может, поэтому команды, измеряющие только финальный вывод, в итоге правят промпты, чтобы залечить проблему нарезки на фрагменты. Основные измерения — recall@k, precision@k и метрика, чувствительная к рангу, например средний обратный ранг или нормированный DCG. Recall@k спрашивает, встречаются ли где-либо в топ-k результатах фрагменты, необходимые для ответа, и именно эта метрика задаёт потолок для всей системы: информация, которая не попала в контекстное окно, не может быть использована, какой бы хорошей ни была модель. Precision@k спрашивает, какая доля вернувшегося действительно релевантна, и это важно, потому что нерелевантный контекст не бесплатен: он расходует бюджет, размывает внимание и даёт модели материал, на котором она уверенно ошибётся. Метрики, чувствительные к рангу, важны там, где реально прочитаны будут лишь первые несколько фрагментов. Всё это требует размеченного набора: вопросов в паре с фрагментами, которые действительно на них отвечают, собранных из реальных пользовательских запросов, а не придуманных. Пятидесяти или нескольких сотен хорошо подобранных примеров обычно достаточно, чтобы ловить регрессии, и построение этого набора — как раз та часть, которую команды пропускают и о которой позже жалеют. Такая оценка превращает изменения в поиске из предмета спора в предмет решения, потому что размер фрагмента, перекрытие, модель эмбеддингов, вес гибридного поиска и реранкер — это всё ручки, эффект которых без неё невидим. Практическое замечание: держите оценочный набор в системе контроля версий рядом с кодом и перезапускайте его в CI при любом изменении нарезки, эмбеддингов или поискового запроса, и всегда фиксируйте, какая модель эмбеддингов построила индекс, — векторы разных моделей несопоставимы, поэтому незаметное обновление модели обесценивает и индекс, и все измеренные по нему числа.","Оценка качества поиска измеряет, извлекает ли RAG-система нужные документы, — отдельно от того, хорошо ли модель написала ответ.",null,[11,14,17,20,23],{"slug":12,"name":13},"chunking","Чанкинг (Chunking)",{"slug":15,"name":16},"eval-harness","Испытательный стенд оценки (Eval Harness)",{"slug":18,"name":19},"golden-dataset","Золотой датасет",{"slug":21,"name":22},"reranking","Реранкинг (Reranking)",{"slug":24,"name":25},"retrieval-augmented-generation","Генерация с дополненным поиском (RAG)",[27,31,35,38,41,45,48,51,54,57,60,61],{"slug":28,"category":5,"name":29,"updated_at":30},"annotation-guidelines","Инструкции по разметке","2026-08-24T03:30:02+00:00",{"slug":32,"category":5,"name":33,"updated_at":34},"baseline-model","Базовая модель (baseline)","2026-08-24T02:46:38+00:00",{"slug":36,"category":5,"name":37,"updated_at":34},"batch-inference","Батч-инференс",{"slug":39,"category":5,"name":40,"updated_at":34},"canary-prompt","Канареечный промпт",{"slug":42,"category":5,"name":43,"updated_at":44},"champion-challenger","Чемпион–претендент (A\u002FB-тестирование моделей)","2026-08-24T02:46:37+00:00",{"slug":46,"category":5,"name":47,"updated_at":34},"class-imbalance","Дисбаланс классов",{"slug":49,"category":5,"name":50,"updated_at":34},"continuous-batching","Continuous Batching (непрерывная пакетная обработка)",{"slug":52,"category":5,"name":53,"updated_at":34},"cross-validation","Перекрёстная проверка",{"slug":55,"category":5,"name":56,"updated_at":34},"data-labeling","Разметка данных",{"slug":58,"category":5,"name":59,"updated_at":44},"drift-detection","Обнаружение дрейфа (Drift Detection)",{"slug":15,"category":5,"name":16,"updated_at":44},{"slug":62,"category":5,"name":63,"updated_at":44},"experiment-tracking","Трекинг экспериментов (Experiment Tracking)"]