Hugging Face · Daily Papers

RAGU:紧凑领域自适应LLM驱动的多步GraphRAG引擎

RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM

Mikhail Komarov, Ivan Bondarenko, Stanislav Shtuka, Oleg Sedukhin, Roman Shuvalov, Yana Dementyeva, Matvey Solovyov, Nikolay O. Nikitin
来自 Novosibirsk State University
二〇二六年七月二十日 · arXiv:2607.11683 · PDF · Code

图检索增强生成(GraphRAG)通过结构化知识增强大语言模型,但现有系统在单次抽取过程中构建知识图谱,会产生噪声实体和脆弱的检索。RAGU 是一个开源模块化 GraphRAG 引擎,通过将抽取与整合分离来解决这一问题:实体和关系经过两阶段类型化抽取、基于 DBSCAN 的去重、大语言模型摘要以及 Leiden 社区检测。一个关键洞察催生了紧凑型抽取器:流水线内大语言模型所需的技能——理解、抽取、基于上下文的推理——都是语言技能,这些技能随模型规模增长很弱,与事实性世界知识不同。据此,我们训练了 Meno-Lite-0.1,一个针对语言技能优化的 7B 模型,它在知识图谱构建上优于 Qwen2.5-32B(相对调和均值提升 12.5%),并在英文 GraphRAG 任务上与之持平。在 GraphRAG-Bench(医学)上,RAGU 在每个事实层级检索到最完整的上下文(证据召回率最高达 0.84,对比 ≤0.76),并在合成任务上超越 HippoRAG2;在多跳事实性问答中,HippoRAG2 的明显优势很大程度上被证明是答案格式的伪影。RAGU 可通过 pip install graph_ragu 安装,在单 GPU 上运行,并以 MIT 许可证发布。源代码公开于 https://github.com/RaguTeam/RAGU,Meno-Lite-0.1 模型可从 https://huggingface.co/bond005/meno-lite-0.1 获取。

译自 Hugging Face · Daily Papers · arXiv:2607.11683 · 录于 二〇二六年七月二十日