DEV Community

Cover image for «retrieval augmented generation»: первый честный бенчмарк - когда графы в RAG вредят
Promptra Team for Promptra

Posted on

«retrieval augmented generation»: первый честный бенчмарк - когда графы в RAG вредят

331 375 токенов - столько в среднем съедает один global-запрос Microsoft GraphRAG по замерам GraphRAG-Bench (arXiv:2506.05690). Обычный векторный RAG на том же корпусе укладывается в 879. Разница - примерно 377 раз, и оплачивает её твой счёт за API.

Обидно другое: на простых фактических вопросах граф за эти деньги отвечает слабее - точность ниже, шума больше, скорость падает. Это показал первый бенчмарк, собранный специально под оценку графовых вариантов retrieval augmented generation, и впервые спор «граф или не граф» закрыт измерениями, а не верой.

Если ты строишь поиск по корпоративной базе знаний и примеряешь GraphRAG, этот разбор - про твой бюджет: где граф выигрывает, где вредит, сколько стоит и как проверить всё на своём корпусе за один вечер. Проверка обойдётся недорого, если модели доступны через один API: в provod.ai (российский OpenRouter) те же GPT и Claude подключаются сменой ключа и base_url, а счёт приходит в рублях. provod.ai - это агрегатор нейросетей для пользователей из России: все флагманы в одном чате и через единый API, оплата в рублях, без VPN.

Что такое retrieval augmented generation простыми словами?

Коротко: архитектура, в которой модель перед ответом идёт во внешнюю базу знаний, достаёт релевантные куски и строит ответ на них, а не на памяти весов. Термин retrieval augmented generation ввели Lewis и коллеги в статье 2020 года (NeurIPS): генератор соединили с непараметрической памятью - плотным векторным индексом Википедии.

Классическая схема проста: документы режутся на чанки, чанки получают векторы, ближайшие к запросу уходят в промпт. Никакой структуры - только похожесть текстов.

GraphRAG от Microsoft (Edge et al., 2024) идёт дальше: LLM проходит по корпусу и вытаскивает сущности и связи, из них строится граф знаний; граф режется на иерархические сообщества, для каждого генерируется summary - и система отвечает на глобальные вопросы вроде «о чём весь этот массив документов». Проект открыли в июле 2024, за четыре месяца он собрал больше 19 000 звёзд на GitHub.

Дальше случилась мода: «граф» стал синонимом «серьёзного RAG», и команды полезли переписывать работающие пайплайны. До июня 2025 не было единого бенчмарка, специально покрывающего GraphRAG и стадии пайплайна, хотя ранние оценки уже вышли у Han et al. и DIGIMON.

Что показал первый бенчмарк, собранный специально под GraphRAG?

Коротко: в июне 2025 вышел GraphRAG-Bench (Xiang et al., v3 - февраль 2026): корпуса дореволюционных романов с Project Gutenberg и медицинских гайдлайнов NCCN, задачи четырёх уровней сложности, метрики каждой стадии - качество графа, ретривал, генерация.

Уровни нарастают: Fact Retrieval (достать один факт), Complex Reasoning (соединить разнесённые факты), Contextual Summarize (свести контекст в сводку), Creative Generation. На каждом меряют точность ответа и Evidence Recall - нашла ли система куски текста, из которых ответ следует.

.

Запомни деталь: бенчмарк измеряет качество графа, ретривал и генерацию; среди метрик есть ACC и Evidence Recall. К противоречиям бенчмарков вернёмся.

Где графы в RAG вредят: три замера

Коротко: на простом фактическом поиске граф проигрывает по точности, на свежих запросах - ещё сильнее, а за скромный выигрыш на multi-hop платишь двукратной латентностью.

Замер первый, GraphRAG-Bench, корпус романов: обычный RAG с реранком набирает 60.92 точности против 49.29 у MS-GraphRAG, Evidence Recall - 83.21%. Вывод авторов сухой: на простых запросах графовая обработка добавляет избыточный и шумный контекст.

Замер второй, Han et al. (февраль 2025): GraphRAG уступает vanilla RAG на 13.4% точности на Natural Questions, а на time-sensitive запросах просадка достигает 16.6%. Причина частично банальна: в автопостроенном графе присутствуют лишь 65.8% сущностей-ответов из HotpotQA и 65.5% из Natural Questions - треть вопросов бьёт мимо графа ещё до рассуждения.

Замер третий, DIGIMON (Zhou et al., март 2025): графовый ретривал повышает глубину рассуждения на multi-hop вопросах HotpotQA лишь на 4.5%, но в среднем в 2.3 раза увеличивает латентность.

Тип запроса Кто выигрывает Цифры Источник
Простой факт, корпус романов RAG с реранком 60.92 против 49.29 у MS-GraphRAG GraphRAG-Bench
Natural Questions vanilla RAG GraphRAG хуже на 13.4% точности Han et al.
Time-sensitive запросы vanilla RAG просадка GraphRAG до 16.6% Han et al.
Multi-hop, HotpotQA граф, ценой скорости +4.5% глубины рассуждения, латентность x2.3 DIGIMON
Complex Reasoning, романы HippoRAG2 ACC 53.38 против 42.93 GraphRAG-Bench

Переворот - на уровнях 2-3: на Complex Reasoning HippoRAG2 даёт ACC 53.38 против 42.93, Evidence Recall 87.9-90.9%, самый высокий в тесте. Граф окупается, когда ответ собирается по кускам из разных концов корпуса.

Сколько токенов сжигает один global-запрос?

Коротко: по данным GraphRAG-Bench (раздел 4.4, корпус романов) средний промпт vanilla RAG - 879 токенов, HippoRAG2 - 1 008, local-режим MS-GraphRAG - 38 707, LightRAG - 100 832, global-режим - 331 375.

Это не абстракция. Каждый токен промпта оплачен по тарифу модели, и один global-запрос стоит как сотни обычных. Умножь на дневной трафик - и разговор про архитектуру станет разговором про бюджет.

Microsoft сам признал проблему: LazyGraphRAG (ноябрь 2024) убирает LLM-вызовы из индексации - она стоит 0.1% от полного GraphRAG, в тысячу раз дешевле, а global-запросы сопоставимого качества обходятся в 700 раз дешевле (5 590 статей AP). В свежем фреймворке Microsoft, на июль 2026, есть инкрементальная индексация (graphrag update, с v0.4.0): local добавляет к запросу 1-3 секунды, global - 8-15.

Академический ответ - LeanRAG (AAAI 2026): сущности агрегируются в иерархию, обход идёт через наименьшего общего предка, контекст на 46% компактнее без деградации ответа (UltraDomain, генератор DeepSeek-V3).

Средний размер промпта на запрос у пяти RAG-конфигураций: от 879 токенов у vanilla RAG до 331 375 у MS-GraphRAG global - по данным GraphRAG-Bench

Шесть GraphRAG-вариантов 2026 года: какой для чего

Коротко: «GraphRAG» в 2026 году - это шесть разных архитектур с разной экономикой. Выбирать надо под тип своих запросов, а не по громкости названия. По состоянию на июль 2026 картина такая (числа - из первичных статей, ссылки в конце).

Вариант Идея Главная цифра Когда брать Ограничение
MS GraphRAG (2024) LLM-экстракция сущностей, иерархические сообщества, summary 331 375 токенов на global-запрос глобальные суммаризации по большому корпусу токенная цена, global - 8-15 с
LazyGraphRAG (11.2024) NLP-экстракция именных групп, LLM убрана из индексации индексация - 0.1% стоимости полного GraphRAG дешёвый старт, частые обновления корпуса именные группы вместо полной LLM-экстракции
HippoRAG2 граф с весами рёбер, зафиксированными на индексации ACC 53.38 на Complex Reasoning multi-hop поиск по фактам статичные веса затягивают блуждание в хабы
LeanRAG (AAAI 2026) иерархия сущностей, обход через наименьшего общего предка контекст на 46% компактнее без потери качества длинные ответы при лимите контекста дополнительная агрегация при построении
Deep GraphRAG (01.2026) трёхстадийный иерархический поиск + RL-дистилляция Qwen2.5-1.5B держит 94%+ качества 72B (Natural Questions, 42.36% EM) дешёвая генерация на маленькой модели дистилляция - отдельный тренировочный проект
CatRAG (02.2026) динамические веса рёбер под конкретный запрос +18.7% к HippoRAG2 на HoVer, Joint Success 31.1% цепочки фактчекинга LLM-вызовы на взвешивание рёбер в рантайме

За пределами таблицы - TagRAG и ParallaxRAG. Первая заменяет entity-граф цепочками объектных тегов: построение в 14.6 раза быстрее GraphRAG, поиск в 1.9 раза, win rate 78.36% против четырёх конкурентов на UltraDomain; плата - доменная таксономия заранее. Второй разводит запросы и триплеты по head-specific пространствам трансформера: WebQSP 78.80 Macro-F1 при 42 секундах против 948 у RoG.

Почему один бенчмарк хвалит графы, а другой ругает?

Коротко: потому что одни измерения сделаны вендорами графовых баз на своих корпусах, а другие - академическими командами по эталонным ответам. Читай методику до вывода.

Пример первого сорта: бенчмарк Diffbot/FalkorDB (апрель 2025) сообщает 56.2% точности с графом знаний против 16.7% без него на 43 корпоративных вопросах, а при более чем пяти сущностях в запросе без графа точность падает до нуля. Writer заявляет 86% у своего GraphRAG на RobustQA против 33-76% у конкурентов. Это vendor claims: корпуса маленькие, методика своя, интерес очевиден.

Вторая причина глубже. Оригинальная оценка Microsoft GraphRAG делалась через LLM-as-judge без эталонных ответов - такая схема завышает результаты. При оценке по ground truth community-based GraphRAG с global search в целом уступает стандартному RAG (разбор RIKER, январь 2026). Когда видишь красивую цифру, первый вопрос - кто судья.

Что GraphRAG не решает

Коротко: свежесть знаний, полноту экстракции, простые сценарии и скорость ответа.

  • Time-sensitive запросы. Просадка 16.6% у Han et al.: граф строится на срезе корпуса, свежие факты в него ещё надо встроить.
  • Неполнота графа. Около трети сущностей-ответов отсутствует в автопостроенном KG. Экстракция корпуса - это по сути data labeling всего массива одной моделью, со всеми её ошибками.
  • Простой FAQ-бот или маленький корпус. Граф здесь чистый оверхед: векторный поиск с реранком отвечает точнее и дешевле.
  • Realtime-чат. Global-запрос - это 8-15 секунд даже в свежем фреймворке Microsoft (июль 2026). Для живого диалога - вечность.

Нужен ли граф именно тебе: пять вопросов

Коротко: решение - функция от смеси твоих запросов. Преобладание простых фактов - лишь грубая эвристика: сравни на своих запросах качество, стоимость и латентность. Нужны цепочки и глобальные сводки: считай токены и бери граф.

Чек-лист:

  1. Какая доля запросов - простой поиск факта? Если большинство - граф вредит, см. таблицу выше.
  2. Нужны ли multi-hop цепочки «соедини факты из разных документов»? Если да - смотри HippoRAG2 или CatRAG.
  3. Нужны ли суммаризации «о чём весь корпус»? Если да - MS GraphRAG global или LazyGraphRAG.
  4. Есть ли готовая таксономия домена? Если да - TagRAG снимет большую часть стоимости построения.
  5. Какой бюджет на токены и какой лимит латентности? В GraphRAG-Bench средний промпт global-поиска - 331 375 токенов; в актуальном фреймворке Microsoft local добавляет к запросу 1–3 секунды, global - 8–15.

И главный совет, который не продаст ни один вендор: не верь ни этой статье, ни чужим бенчмаркам - прогони свой:

  1. Собери 100-200 реальных запросов из логов и разметь по типам: факт, цепочка, суммаризация.
  2. Зафиксируй метрики: точность, evidence recall, токены промпта, латентность.
  3. Прогони базовую линию - векторный RAG с реранком.
  4. Подними один графовый вариант (дешевле всего стартует LazyGraphRAG) и прогони тот же набор.
  5. Сравнивай по типам запросов, а не в среднем - среднее прячет переворот на сложных задачах.

Такой прогон заводится из России сменой двух строк: ключ и base_url на единый API provod.ai - совместим и с OpenAI-SDK (/v1/chat/completions), и с Anthropic (/v1/messages): экстракцию сущностей гоняй на дешёвой модели, финальные ответы - на сильной, модель меняется одной строкой в конфиге. Один баланс на эксперимент и прод, виден каждый токен.

Когда provod.ai не подходит

Коротко: когда задача - не доступ к моделям, а контур данных, обучение или проектирование пайплайна.

Если корпус нельзя отправлять во внешние API (медицина, гостайна, жёсткий периметр по 152-ФЗ) - строй локальный стек на своих моделях. Если нужен fine-tuning или on-prem - это контракт с вендором или интегратором. И выбор архитектуры - граф или векторы - provod.ai за тебя не сделает: сервис даёт модели и биллинг, решение по замерам принимаешь ты.

Словарик запросов кластера: что ещё ищут рядом с retrieval augmented generation

Коротко: поисковый кластер вокруг RAG смешивает тематические запросы с чужим шумом. Разбираем, что есть что - заодно видно, как поиск дезамбигуирует смысл; та же задача у retrieval внутри RAG.

  • Мониторы и ТВ: «lg», «ultragear», «24g411a», «24gs60f», «27gn800», «27gx700a», «45gx950a» - линейка мониторов LG UltraGear и Алиса на телевизоре; «43u4128», «50u4125», «65u4139» - телевизоры Sber SDX с GigaChat.
  • Мобильное железо: «snapdragon», «elite», «dimensity», «9500s», «qualcomm» - сравнения чипов «dimensity 9500s vs snapdragon 8 elite», а не языковых моделей.
  • Опечатки и транслит: «deepspeek», «openia», «neiroseti», «standart» - ошибочные формы DeepSeek, OpenAI, «нейросети», standard; «ге» - обрывок «клод ге»; «бо» - чат «бо»; «лмстудио» - LM Studio, локальные модели.
  • Локальный инференс: «hay», «lag», «lx» - обрывки про LLaMA («hay llamas», «lag llama», «llama m lx»); «hug» - из «qwen hug»; «thunderboltex», «transcriptions» - сборка llama.cpp и audio transcriptions; «gh» - «gh repo clone» для automatic1111.
  • Видеогенераторы: «ao», «blood», «dm», «freitag», «keyframes», «lipsync» - запросы к Kling (фичи keyframes и lipsync); «о1», «днр», «мчс» - темы генераций («клинга о1», «клинга днр», «клинга мчс»); «toe» - «midjourney toe bot».
  • Вокруг Gemini: «band» - приёмник «bayckrc dual band gemini rx»; «gem-08usb», «gem-12usb» - аудиоинтерфейсы; «s2x» - «gemini i s2x»; «mobileconfig» - DNS-конфиг «для геминь»; «gl» - «чат с персонаж gl».
  • Музыка и мемы: «buba» - «sora ai buba vk»; «bum» - «suno ai bum bum»; «meme» - «grok meme»; «afro», «papaoutai» - «алиса, включи papaoutai afro soul»; «бом» - «тить тить бом»; «миа» - «песня миа боёк»; «соу» - «соу дигидг»; «хип» - «suno хип хоп»; «gaga» - «lady gaga»; «канди» - «канди вест»; «bang» - «ai cover bang»; «bsprod» - «морской ветер bsprod»; «compilation», «poets» - «ai russian poets covers compilation»; «fishaudio» - аудиогенератор.
  • Переводы: «gefragt», «hast», «mich» - «du hast mich gefragt перевод», строчка Rammstein; «courageous» - «courageous перевод».
  • Торренты: «tragtorr» - трекер из «tragtorr in torrent»; «pragmata» - игра Pragmata; «filmmaker» - «filmmaker ai профессия будущее».
  • Картинки-генераторы: «gama» - нейросеть для презентаций; «geet», «raphael», «textpower», «unitol», «unitoll», «визарди» - названия из запросов «сгенерировать картинку»; «межзвездные» - «межзвездные корабли»; «ежика» - «голос ежика из смешариков»; «лем» - кусок «сәлем, алиса»; «пао» - генератор промтов.
  • Поздравления и Алиса: «сестренка», «тетю» - «с днём рождения, сестренка» и «тетя» нейросетью; «сошел» - «алиса, я сошел с ума»; «путем» - «путем книга аудиокнига»; «актерское» - актерское портфолио нейросетью.
  • Файлы и доступ: «assets», «mp» - «downloading server assets rage mp», игровые серверы; «yandexcloud» - файлохостинг storage yandexcloud net; «v2raytun» - VPN-утилита; «checkcoverage» - проверка iPhone на checkcoverage apple com.
  • Другие retrieval: «conversion» - «rvc retrieval based voice conversion», клонирование голоса; retrieval есть, но про звук.
  • Парфюм: «haute», «fragrance», «devil» - духи «haute fragrance company devil s intrigue».
  • Редкий сосед по теме: «Mistral», «devstral» - кодовая модель devstral от Mistral, настоящая LLM.
    .

  • Другие retrieval: «conversion» - «rvc retrieval based voice conversion», клонирование голоса; retrieval есть, но про звук.


provod.ai — ведущие видеомодели в одном рабочем контуре

Сравнивайте подходы и выбирайте генератор под ролик, бюджет и темп производства: команде не нужно заводить отдельный баланс и заново организовывать доступ для каждого видеопровайдера.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Стоимость видео сохраняет официальный тариф 1:1: без собственной надбавки provod.ai за доступ к разным моделям.

Выберите видеомодель под свой сценарий: форма регистрации · цены на модели · защита данных по 152-ФЗ · главная provod.ai

FAQ

Коротко: пять ответов, не поместившихся в текст.

GraphRAG всегда сильнее обычного RAG?
Нет. На простых фактах он слабее и дороже: 60.92 против 49.29 в пользу векторного поиска с реранком (GraphRAG-Bench). Выигрыш начинается с multi-hop и суммаризаций - и его надо мерить на своём корпусе.

Во сколько реально обходится GraphRAG?
Global-запрос - в среднем 331 375 токенов против 879 у обычного RAG. LazyGraphRAG режет индексацию до 0.1% полной стоимости, а graphrag update (июль 2026) убирает перестройку графа при дельтах.

Корпус уже с классификацией - что брать?
TagRAG: теги вместо автовыделенных сущностей, построение в 14.6 раза быстрее GraphRAG, чистая инкрементальная вставка документов. Ограничение - таксономия нужна заранее.

Можно ли обойтись маленькой моделью?
Deep GraphRAG показывает: Qwen2.5-1.5B после RL-дистилляции достигает 94%+ качества 72B-интегратора на Natural Questions (42.36% EM). Но дистилляция - отдельный проект, не коробочная фича.

Что почитать по теме?
Книга Дэниса Ротмана «RAG-Driven Generative AI» (Packt, 2024, 334 страницы) - системный учебник; свежие цифры - в первичных статьях ниже.

Граф или не граф - теперь вопрос замера, а не моды. Если 80% твоих запросов - простой поиск фактов, граф тебе не нужен; если нужны цепочки рассуждений и глобальные сводки - платить придётся, и считать токены стоит заранее.

Честный trade-off: готов ли ты платить за global-запрос как за 377 обычных ради +4.5% глубины на multi-hop - или у тебя и таких запросов нет? Напиши в комментариях свою смесь запросов - поспорим, что выбрать.

Один ключ provod.ai - прогони свой бенчмарк на всех моделях: рубли, без наценки, свой бенчмарк

Актуальный список моделей и цены в рублях - на provod.ai. Один баланс: индексируешь корпус на дешёвой модели, отвечаешь пользователям на сильной, условия оплаты, включая условия для юрлиц, уточняй у provod.ai.

Источники:

Top comments (0)