Назад в ленту

GraphRAG против векторного RAG: когда граф знаний реально окупается

Сравнение GraphRAG и векторного RAG: сильные стороны, стоимость и подводные камни

Retrieval-augmented generation уже два года мучает всех одинаково: нарезаешь документы на чанки, ищешь похожие куски, отдаешь модели — и молишься. Простые вопросы проходят на ура, а сложные, где нужно собрать ответ из пяти абзацев, рассыпаются. Модное спасение — GraphRAG: мол, построй граф знаний и забудь о проблемах. Но так ли это на самом деле?

Мы прошерстили оригинальное исследование Microsoft и четыре независимых бенчмарка, чтобы выяснить, когда графы действительно выигрывают, а когда превращаются в дорогой и бесполезный балласт. Спойлер: ответы зависят от вопроса, а не от моды.

Классический RAG: почему векторный поиск пасует перед сложными вопросами

Три структурные ловушки векторного поиска

Проблема не в качестве эмбеддингов и не в мощности моделей. Виновата сама конструкция. У классического RAG есть три врожденных дефекта, и каждый из них стоит денег тем, кто дочитал до этого абзаца.

Первое — невозможность соединять точки. Когда ответ требует склеить факты из разных пассажей через общую сущность, изолированные чанки не раскрывают связь. Они вообще не знают о существовании друг друга.

Второе — слепота к глобальным вопросам. Поиск по косинусному сходству всегда возвращает лишь несколько фрагментов, поверхностно похожих на запрос. Ему неоткуда взять понимание всего корпуса целиком. Спросите про сквозные темы — и получите случайные куски, которые вроде бы содержат нужные слова, но не дают ни грамма смысла.

Третье — обрыв контекста на границах чанков. Иерархия, взаимосвязи, последовательность рассуждений — ровно то, что нужно для сложного анализа, выбрасывается при нарезке документа в угоду удобству индексации.

В Microsoft Research описали эту боль безжалостно точно, когда представляли GraphRAG: базовый RAG «изо всех сил пытается соединить точки» и показывает слабые результаты, когда речь заходит о целостном понимании семантических концепций над большими коллекциями данных.

Именно на этом поле классический RAG проигрывает битву ещё до того, как задан первый вопрос. Это не приговор, а лишь приглашение к разговору о том, как устроены альтернативы. Но об этом — в следующем разделе.

GraphRAG: как граф знаний перестраивает контекст для LLM

Граф знаний: сущности как города, отношения как дороги

Вместо того чтобы скармливать модели разрозненные кусочки текста, Graph Rag на этапе индексации превращает корпус в настоящую сеть. LLM читает каждый чанк и вытаскивает оттуда сущности, связи между ними и утверждения — все это собирается во взвешенный граф знаний. Получается не плоский список фактов, а объемная карта, где у каждой сущности есть координаты и соседи.

Дальше в дело вступает алгоритм Leiden. Он кластеризует граф в иерархию тематических сообществ — этакие районы внутри города знаний. Для каждого такого сообщества заранее пишется естественно-языковое саммари. Зачем? Чтобы к моменту запроса у системы уже были готовые «выжимки» по каждой теме, а не сырые данные.

Map-reduce: как граф отвечает на вопросы

Когда приходит запрос, Graph Rag запускает двухфазный механизм. Сначала каждое релевантное сообщество генерирует частичный ответ — это шаг map. Затем все эти частичные ответы ранжируются и сливаются в единый финальный ответ — шаг reduce. Синтез происходит на основе структуры графа, а не пары случайно найденных сниппетов.

Альтернативный вариант — HippoRAG — идет другим путем: использует граф и Personalized PageRank, чтобы найти нужные фрагменты, и достигает похожего эффекта. Разница в инструментах, а не в философии.

Ключевая идея проходит красной нитью: релевантность контекста определяется отношениями между сущностями, а не только векторным сходством. Это принципиально другой подход к тому, что вообще считать «похожим» на запрос.

Граф знаний — не серебряная пуля и не обязательный апгрейд для каждого проекта. Это тяжелая артиллерия для вопросов, где нужно соединять разрозненные факты через связи между ними. И, как показывают свежие исследования, именно там Graph Rag отрывается от классического векторного поиска на десятки пунктов. Но об этом — дальше.

Исследования GraphRAG: сухие цифры эффективности

Хорошо, с теорией разобрались. Теперь время самой интересной части — когда красивые рассуждения упираются в сухие цифры. И цифры эти, как водится, рассказывают историю куда более увлекательную, чем любой маркетинговый питч.

Глобальные вопросы: где Microsoft GraphRAG разносит конкурентов

Начнём с самого громкого кейса — оригинального исследования Microsoft GraphRAG. Авторы взяли датасеты на миллион токенов и заставили наивный векторный RAG сражаться с графовым подходом на вопросах уровня «осмысли весь корпус целиком». В качестве судьи выступила LLM, оценивающая полноту, разнообразие и «полезность» ответов. Результат? GraphRAG выиграл по полноте в 72–83% сравнений и по разнообразию в 62–82%. То есть без малого две трети, а то и четыре из пяти — на тех самых вопросах, где классические чанки просто разводят руками.

Отдельный шик — экономия токенов. Саммари верхнего уровня, которое подаётся модели, потребляло до 97% меньше токенов, чем обработка исходного текста напрямую. Почти в сорок раз компактнее — и при этом результат лучше. Такое не спишешь на случайность.

Мультихоп-задачи: Recall@5 улетает вверх

Второй блок доказательств — это то, достаёт ли поиск нужные фрагменты в принципе. На стандартных бенчмарках для многошаговых рассуждений MuSiQue, HotpotQA и 2WikiMultiHopQA граф-направленный поиск поднимает Recall@5 с 73.4% до 87.8%. Прибавка в 19.6 пункта — это не проценты, а целая пропасть.

Самые сладкие цифры спрятаны на сложных кросс-документных наборах. На MuSiQue прирост составил +31 пункт, на 2Wiki — +28. И это ровно те кейсы, где обычный чанковый поиск традиционно тонет: информация размазана по десяткам документов, и без графа связей её просто не собрать.

HippoRAG: дёшево, быстро и зло

Отдельного упоминания заслуживает HippoRAG. Этот вариант не стал церемониться и вместо тяжёлого map-reduce использует Personalized PageRank по графу. Результат — до 20% прироста точности на мультихоп-задачках. Но главное не это. HippoRAG добивается этого при стоимости в 10–20 раз ниже и скорости в 6–13 раз выше, чем итеративные методы поиска. Дёшево и сердито — лучший способ описать этот подход.

Честный эксперимент: Michigan State и Meta* против всех

Конечно, хотелось бы сказки о безоговорочном превосходстве. Но в 2025 году исследователи из Michigan State и Meta* провели максимально чистый замер: единый протокол, одинаковые чанки, одни и те же эмбеддинги. И вот тут картина стала по-настоящему интересной.

На одношаговых фактологических вопросах из Natural Questions обычный RAG обошёл все графовые семейства, пусть и с минимальным отрывом: F1 64.8 против 63.0. А вот на многошаговых рассуждениях в MultiHop-RAG граф вырвался вперёд: 70.3 против 67.0 по общей точности. Вывод простой: контекстный граф — это не универсальный апгрейд, а заточенный инструмент, который окупается ровно там, где нужно думать, а не искать телефонный номер.

GraphRAG-Bench: точная граница применимости

Самый свежий бенчмарк, GraphRAG-Bench с ICLR 2026, окончательно дорисовал карту. На простом извлечении фактов граф проигрывает текстовым чанкам почти вничью: 60.1 против 60.9. Структура тут — просто лишний балласт. Но чем глубже требуются рассуждения, тем сильнее разрыв. На сложных логических цепочках граф выдаёт +10 пунктов (53.4 против 42.9), а на контекстной суммаризации — и вовсе +13 пунктов (64.4 против 51.3).

Читается это так: GraphRAG — это не волшебная таблетка, а скорее тонкий хирургический инструмент. В руках того, кто понимает, когда его доставать, он творит чудеса. В руках того, кто графит каждый чих, — просто сжигает бюджет.

Стоимость, подводные камни и когда применять GraphRAG

Если вы уже собрали векторную базу и теперь смотрите на граф знаний, как на обязательный апгрейд — притормозите. У этого решения есть не только цена в долларах, но и скрытые подводные камни, о которых не пишут в анонсах.

Индексация графа: сколько это стоит на самом деле

Построение графа — дорогое удовольствие. На этапе индексации LLM приходится читать каждый чанк и вытаскивать из него сущности, связи и утверждения. Это не халявная операция: по оценкам, обработка корпуса среднего размера через GPT-4o обходится примерно в $48. Для сравнения, обычный векторный индекс — почти бесплатный.

Microsoft, похоже, сама поняла, что бюджет пугает. Их ответ — LazyGraphRAG, который откладывает извлечение до момента запроса и ужимает стоимость до 0,1% от оригинала. Фактически это молчаливое признание: стандартный вариант для многих команд просто неподъемен.

Судьи с изъяном: почему победы GraphRAG не всегда честные

Вторая проблема — оценка. Многие исследования просят LLM выступить судьей и сравнить ответы. Звучит удобно, но у таких судей есть систематические ошибки. Позиционное смещение: поменяйте порядок двух ответов местами — и заветный win-rate может качнуться более чем на 30 пунктов. Плюс длина: модель любит ответы подлиннее. Плюс нестабильность: один и тот же замер в разных прогонах выдает разные результаты.

После коррекции этих искажений один популярный метод потерял почти всё: его рейтинг упал с 66,7% до 39% — то есть ниже отметки 50%, где начинается «раньше было лучше». Вывод простой: крупные победы GraphRAG на многошаговых вопросах — реальны, а вот узкие преимущества в «полноте» и «разнообразии» стоит перепроверять на эталонных метриках.

Когда граф действительно окупается

Если отбросить хайп, правило получается на удивление приземленным. Граф знаний нужен тогда, когда вопросы требуют соединять факты из разных кусков корпуса: многошаговые запросы, глобальные «что у вас вообще происходит» и смысловой анализ связных массивов данных — исследовательские библиотеки, истории инцидентов, базы знаний.

Для простых фактов типа «какой номер телефона на третьей странице» граф — выброшенные на ветер деньги. Тут текст-чанки справляются и дешевле, и быстрее. А самый разумный вариант — гибрид: либо маршрутизировать запрос между двумя подходами, либо объединять улики из графа и чанков вместе. Судя по исследованиям, гибрид стабильно бьет каждого из конкурентов по отдельности.

GraphRAG — это не волшебная таблетка и не пустышка, а узкоспециализированный инструмент. Вопрос только в том, умеете ли вы выбирать нужный инструмент под задачу.

Спор «чанки против графов» скоро станет таким же бессмысленным, как спор между молотком и отверткой. Гвоздь — молоток, шуруп — отвертка. Лучшие пайплайны уже учатся менять инструмент на лету, и именно они заберут победу в 2026-м. Остается следить, кто первым доведет такую маршрутизацию до ума.

Справка по теме (FAQ)
Что такое GraphRAG?
GraphRAG — это подход, при котором на этапе индексации LLM извлекает из чанков сущности, связи и утверждения, формируя взвешенный граф знаний. Затем алгоритм Leiden кластеризует граф в иерархию тематических сообществ, для каждого из которых заранее пишется естественно-языковое саммари. При запросе эти саммари используются как контекст для генерации ответа.
Почему построение графа — дорогое удовольствие?
Индексация требует, чтобы LLM прочитал каждый чанк корпуса и выделил из него сущности и связи. По оценкам, обработка корпуса среднего размера через GPT-4o стоит примерно $48. LazyGraphRAG от Microsoft снижает стоимость до 0,1% за счет отложенного извлечения — граф строится не заранее, а уже в момент запроса.
В чем проблема LLM-судей в бенчмарках?
LLM-судьи обладают систематическими ошибками: позиционным смещением (смена порядка ответов меняет win-rate более чем на 30 пунктов), предпочтением длинных ответов и нестабильностью между прогонами. После коррекции один популярный метод потерял результат с 66,7% до 39%, то есть упал ниже случайного уровня.
Когда лучше использовать граф, а когда — обычные чанки?
Граф оправдан для многошаговых, глобальных и смысловых вопросов на связных корпусах (библиотеки, истории инцидентов, базы знаний). Для простых фактов дешевле и быстрее работают текст-чанки. Оптимальный вариант — гибридный RAG, где запросы маршрутизируются между подходами или объединяют улики из обоих источников.
* Деятельность организации «Компания Meta (социальные сети Instagram и Facebook)» признана экстремистской и запрещена в РФ.