Сначала был простой вопрос: «Какой у нас был возврат денег в третьем квартале?» Векторный RAG отвечает за секунду. Потом приходит вопрос сложнее: «Какие темы повторяются в жалобах клиентов за два года?» Система замолкает. Ни один кусок текста не содержит ответа целиком, а модель умеет доставать только похожие отрывки. Архитектор R&D из Persistent Systems Даттарадж Рао разобрал оригинальную работу Microsoft и четыре независимых бенчмарка, чтобы ответить на вопрос: когда граф знаний реально бьёт текстовые куски, а когда это лишние расходы.

Почему текстовые куски упираются в стену

Обычный векторный RAG ищет k отрывков, больше всего похожих на запрос. У этой схемы три слепых зоны. Ответ требует соединить факты из разных кусков через общую сущность: куски, встроенные по отдельности, эту связь не показывают. Вопрос «какие здесь главные темы?» требует всего корпуса, а поиск по сходству возвращает горсть кусков. Связи и иерархия, на которых держится сложное рассуждение, пропадают на границах кусков.

В Microsoft Research сформулировали это прямо: базовый RAG «с трудом соединяет точки» и плохо отвечает на вопросы о смысле больших массивов данных.

Что меняет граф контекста

GraphRAG работает до того, как задан вопрос. На этапе индексации LLM читает каждый кусок, вытаскивает сущности, связи и утверждения и собирает их во взвешенный граф знаний. Затем алгоритм Лейдена делит граф на иерархию тем, и для каждой темы заранее пишется краткое содержание на естественном языке.

В момент запроса эти сводки делают основную работу: каждая тема готовит частичный ответ (шаг map), части ранжируются и объединяются (шаг reduce), и модель выдаёт итог, опираясь на структуру, а не на несколько случайных кусков. Вариант HippoRAG идёт другим путём: граф плюс обход Personalized PageRank для поиска нужных отрывков. Идея одна: контекст модели определяют связи между сущностями, косинусная близость перестаёт быть единственным фильтром.

Четыре исследования, одна закономерность

Глобальные вопросы: главная победа

Microsoft сравнила GraphRAG с наивным RAG на вопросах «осмыслите весь корпус» поверх датасетов на миллион токенов. Судьёй выступала LLM по трём осям: полнота, разнообразие и полезность. GraphRAG выиграл 72-83% сравнений по полноте и 62-82% по разнообразию. Самые высокоуровневые сводки тратили до 97% меньше токенов, чем обработка исходного текста.

Ключевые цифры сравнения GraphRAG и векторного RAG:

  • 72-83% побед по полноте ответов на глобальные вопросы
  • 62-82% побед по разнообразию ответов
  • До 97% меньше токенов на сводки верхнего уровня
  • Recall@5 растёт с 73,4% до 87,8%, прирост 19,6 пункта

Многошаговый поиск: граф находит то, что куски пропускают

Второй вопрос: попадает ли нужный отрывок в топ результатов. На стандартных бенчмарках многошаговых вопросов (MuSiQue, HotpotQA, 2WikiMultiHopQA) граф-ориентированный поиск поднимает Recall@5 с 73,4% у наивного RAG до 87,8%. Самые большие скачки на сложных наборах с пересечением документов: +31 пункт на MuSiQue и +28 на 2Wiki. HippoRAG сообщает о приросте точности до 20% на многошаговых вопросах при стоимости в 10-20 раз ниже и скорости в 6-13 раз выше итеративных методов поиска.

Контролируемое сравнение: где всё честно

Исследование 2025 года от Michigan State и Meta прогнало RAG против четырёх семейств GraphRAG по единому протоколу: одинаковые нарезка, эмбеддинги и генерация. Победителя нет. На одношаговом поиске фактов (natural questions) обычный RAG чуть впереди: F1 64,8 против 63,0 у лучшего графового метода. На многошаговых рассуждениях (MultiHop-RAG) граф выходит вперёд: 70,3 против 67,0.

Граф контекста работает точечно: окупается там, где ответ требует рассуждений через несколько кусков.

Вердикт по типам задач

Самый свежий бенчмарк GraphRAG-Bench (ICLR 2026) отвечал на вопрос: в каких сценариях графы дают измеримую пользу. Простой поиск фактов: куски 60,9 против графа 60,1, это ничья, структура графа тут лишний груз. Сложные рассуждения: граф 53,4 против кусков 42,9, плюс 10 пунктов. Контекстное обобщение: граф 64,4 против 51,3, плюс 13 пунктов. Закономерность читается сверху вниз: преимущество графа растёт вместе с глубиной рассуждений, а на изолированных фактах куски держат позиции.

Цена вопроса и предвзятость судей

Два обстоятельства мешают назвать эту победу безоговорочной. Построение графа стоит денег: LLM извлекает сущности и связи из всего корпуса. Один анализ оценил индексацию умеренного корпуса около 48 долларов на GPT-4o, заметно дороже обычного векторного индекса. Следующая версия Microsoft, LazyGraphRAG, переносит извлечение на момент запроса и снижает стоимость до 0,1% от исходной. Это признание того, что прежний бюджет для многих внедрений неподъёмен.

Второе: многие победы оценивает другая LLM, а у таких судей есть системные смещения. Независимый аудит нашёл смещение позиции (перестановка ответов меняет долю побед более чем на 30 пунктов), смещение длины и смещение повторов: одинаковые сравнения расходятся между запусками. После коррекции один популярный метод упал с заявленных 66,7% побед до 39%, ниже порога 50%. Крупные приросты, вроде +20% точности на многошаговых вопросах и +15-30 пунктов recall, устойчивы. Узкие отрывы по полноте стоит перепроверять метриками на основе эталона.

Когда брать граф, а когда нет

Если убрать шумиху, решение простое. Граф контекста нужен, когда вопросы многошаговые, глобальные или требуют осмысления, когда нужны полные ответы с разных сторон, а корпус густо связан: исследовательские библиотеки, архив дел, история инцидентов, базы знаний. Текстовые куски оставляем, когда запросы сводятся к поиску одного факта, корпус небольшой или плоский, а стоимость индексации, задержка и простота важнее небольшого прироста качества.

Лучший вариант гибридный. Исследования сходятся на одном: маршрутизируйте каждый запрос к подходящему методу или объединяйте улики из обоих. Совместное использование графа и кусков стабильно бьёт каждый из методов по отдельности. Выбирать одну сторону не нужно: нужен маршрутизатор.

Что это значит для бизнеса

Компании во Владивостоке и на Дальнем Востоке, которые строят нейросети для бизнеса на корпоративных базах знаний, получают практический ориентир. Если вопросы к системе одношаговые, вроде «какой номер телефона на странице 3», граф добавит только расходы. Если системе предстоит связывать факты из разных документов, обобщать жалобы, отчёты или историю обращений, граф окупается: прирост recall до 20-30 пунктов на сложных запросах.

Внедрение искусственного интеллекта в компании обычно начинается с RAG поверх документов. Прежде чем платить за построение графа, посчитайте, какие вопросы зададут системе. Автоматизация с помощью ИИ даёт эффект, когда архитектура выбрана под задачи, а не под модный термин. Начать стоит с бесплатного аудита: разберём, какие процессы вашей компании выиграют от RAG, а где хватит простого поиска.