GraphRAG

GraphRAG усиливает retrieval-augmented generation графом знаний, построенным из корпуса. При индексации LLM извлекает из каждого документа сущности и связи между ними, собирает их в граф, кластеризует его в сообщества и пишет резюме на каждом уровне. Во время запроса система может обходить связи и обращаться к резюме сообществ, а не только сопоставлять семантически похожие фрагменты. Это бьёт по двум самым слабым местам обычного RAG: многошаговые вопросы («каких клиентов затронул сбой, вызванный поставщиком?»), ответ на которые размазан по документам, не связанным ни одним фрагментом, и глобальные вопросы («каковы главные темы этого корпуса?»), на которые поиск по сходству не отвечает вовсе. Паттерн популяризовал открытый GraphRAG от Microsoft (2024). Издержки: дорогая индексация — извлечение сущностей сжигает LLM-токены по всему корпусу — и поддержка графа при изменении документов. Большинство команд применяют его выборочно, рядом с векторным ретривалом, в доменах с плотными связями, а не как полную замену.

Похожие термины

Ещё термины: Данные и инфраструктура