来源:互联网 更新时间:2026-08-15 14:56
发布时间:2024 年 04 月 24 日
From Local to Global: A Graph RAG Approach to Query-Focused Summarization
摘要:通过检索增强生成(RAG),大型语言模型(LLM)能够从外部知识源检索信息,从而回答涉及私有或未见文档的问题。然而,RAG 在处理全局问题(如“数据集的主要主题是什么?”)时表现不佳,因为这类问题本质上是查询聚焦的摘要任务,而非直接检索。现有的 QFS 方法也难以处理大规模文本。为此,我们提出图 RAG 方法,该方法结合了两种方法的优势,能够随着问题普遍性和文本量的增加而扩展。图 RAG 通过 LLM 构建图索引,先从文档中提取实体图,再预生成相关实体的摘要。在回答问题时,每个摘要生成部分答案,最终汇总为完整回答。实验表明,图 RAG 在处理大规模数据集的全局问题时,能显著提升答案的全面性和多样性。全球和本地图 RAG 的开源 Python 实现即将发布。
https://arxiv.org//pdf/2404.16130
最近微软终于开源了GraphRAG,短短7天就集齐了6.7K Star。那GraphRAG到底是个啥???
GraphRAG的论文其实比代码开源要早得多——今年4月就在Arxiv上发表了,但代码是7月1号才正式上传的。项目已经开源,代码和详细文档都能在GitHub上找到,感兴趣可以直接去翻。
RAG,也就是检索增强生成,如今已经成为大语言模型应用的核心组件之一。它的原理很简单:从外部知识源——无论是向量数据库、传统搜索引擎还是其他检索系统——找到相关片段,然后喂给LLM来回答私有数据或未见过的文档问题。凭借这一能力,RAG在处理企业内部文档、商业文件、用户对话记录这些全新数据集上,确实表现不俗。
但问题也来了。当需要整合多个文档、多个片段的信息,来回答一个涉及全局视角的问题(比如“这份数据集的几个主要主题是什么?”),传统RAG往往力不从心——它擅长找相似片段,但不擅长把这些片段拼成一张完整的拼图。
• 处理多信息点时存在困难——如果问题的回答需要跨文档、跨片段提供全新见解,传统RAG在全面性上就露怯了。
上图是GraphRAG的整体流程,分为两个阶段:索引阶段和查询阶段。索引阶段利用LLM来自动构建知识图谱,提取出节点(实体)、边(关系)和协变量(主张)。然后采用社区发现算法(比如Leiden算法)把整个图谱划分为若干子图,再自底向上用LLM为每个子图生成摘要总结。到了查询阶段,针对用户提问,“全局答案”会汇总所有相关社区摘要,最终生成一条完整的回答。
和传统RAG一样,GraphRAG也要先把源文档切分成文本片段(TextUnits)。这些片段既要用于后续的图谱抽取,也要作为知识引用的来源——方便追溯到原始文本。
在最新开源的代码里,文本切分大小(按Token数算)是可以根据需求调的。默认是300个Token,但作者发现1200个Token的文本单元效果更好。不过代价也很明显:更大的文本块尺寸会导致输出精度和召回率下降,参考文本的可读性也会变差;好处是能减少LLM调用次数,整个处理速度更快。

上图可以看出:同样的提取循环次数下,文本片段越大,提取出的实体数量也会越多。
文本单元的分组设置也可以定制。默认情况下,GraphRAG会按文档边界来对齐单元——每个文档严格对应一组文本单元。不过也有特殊情况:当文档特别短(比如推文、聊天记录),几个文档会被合并成一个有意义的分析单元。
接下来就是关键步骤:对每一段文本片段,利用LLM从中提取实体、关系、主张。下图是GraphRAG知识图谱构建时用的提示词模板。

提示词的具体内容这里就不展开了,感兴趣可以直接去项目里翻对应的模板文件:./prompt_tune/template/entity_extraction.py。
通过LLM从文档中提取实体、关系、主张,本质上是对文档的一种
图谱抽取的最后一步,是对那些代表同一现实世界实体但名称不同的实体进行消歧。这个过程也是通过LLM完成的——把一系列实体喂给LLM,让它判断哪些该合并。不过目前的实现是“破坏性”的:被判断为同一实体的会直接合并成一个,它们的关系也会跟着更新。
GraphRAG正在探索其他的实体消歧技术。未来计划在实体之间建立一条“已识别”的边,这样用户就可以撤销索引端的消歧,或者用类似方法添加自己的非破坏性判断——灵活性会更高。
上一步构建的索引可以看作一个均匀无向加权图:实体是节点,关系是边,边的权重反映了检测到的关系实例数量(归一化后)。基于这个图,可以用社群发现算法把图递归划分成多个社群——社群内部节点联系紧密,不同社群之间相对稀疏。GraphRAG选用了Leiden算法,因为它在大规模图谱上能高效挖掘层级社群结构。
这个层级结构每一层都提供了一种划分方式,互不重叠且覆盖所有节点。这就为全局性摘要的“分而治之”策略打下了基础。
接下来,利用每个社群(即知识图谱的子图),用LLM为其生成一份摘要式报告。这样可以从不同细节层次获得宏观理解:如果社群位于最顶层,你会得到整个图谱的综合报告;如果是较低层,报告会更聚焦于某个局部群体。
通过提示词里的示例,能大概看出这个报告长什么样。然后LLM会把这些报告浓缩、精简,再用embedding模型向量化。这一步跟传统RAG的思路很像。
所以,整个GraphRAG最核心、最特别的,其实就是知识图谱提取和这一步的子图摘要式总结。
用户提问后,利用社群层级结构,可以用不同层级的社群摘要来回答问题。具体生成过程分三步:
• 准备社群概要:把社群概要随机打乱,按预设的Token大小切成若干块。这么做是为了让相关信息均匀分布到不同的上下文窗口里,避免信息扎堆导致遗漏。
• 映射社群解答:并行地为每个区块生成中间答案。同时要求LLM给答案打个分(0到100),0分表示完全没用,直接排除。
• 汇总为全局答案:根据有用性得分,把中间答案降序排列,依次整合进新的上下文窗口,直到达到Token限制。最终这个上下文会用来生成返回给用户的全局答案。
作者对比了六种配置的RAG:包括利用四层图社群结构的GraphRAG(C0、C1、C2、C3),以及将Map-Reduce应用于原始文本的文本摘要方法(TS)和语义搜索RAG(SS)。
C0:利用根层级的社群概要响应查询——数量最少,最宏观。
C1:利用高级别社群概要(C0的子社群,如果存在的话;否则是C0的下投影)。
C2:利用中层级社群概要(C1的子社群,如果存在)。
C3:利用底层社群概要,数量最多,最细致。
TS:和GraphRAG类似,只是把原始文本(而非社群概要)随机分块,用于map-reduce摘要。
SS:朴素RAG——检索文本块,塞进上下文窗口直到Token限制。
上图展示了四种度量指标下,每组125个问题(重复五次取平均值)的胜率对比。每行代表的条件与每列的条件比较,胜者用粗体标出。自我胜率没算,以50%作为参考线。
在全面性和多样性上,GraphRAG的所有条件都碾压了朴素RAG。特别是C1到C3,相比TS(没有图索引的全局文本摘要)也有一点点提升。
全局方法在全面性和多样性两个维度上,无论播客数据集还是新闻数据集,都持续碾压朴素RAG(SS)。具体来说:全局方法在播客文稿上的全面性胜率在72%到83%之间,新闻文章上在72%到80%之间;多样性胜率分别为75%到82%和62%到71%。作为检验,直接性指标符合预期——朴素RAG在所有对比中提供了最直接的回答。
对比社群摘要和原始文本,社群摘要在提升答案全面性和多样性上普遍带来了虽小但稳定的改进——根级摘要除外。
• 播客数据集中,中级社群摘要的全面性胜率57%
• 新闻数据集中,低级社群摘要的全面性胜率64%
多样性方面:
• 播客中级社群摘要57%,新闻低级社群摘要60%。
上表展示了GraphRAG在可扩展性上的优势:对低级社群摘要(C3),所需上下文Token比原始文本摘要少了26%到33%;对根级摘要(C0),Token需求更是减少了97%以上。尽管性能略有下降,根级GraphRAG仍是一种高效的迭代问答方法——尤其在感知类任务中,其全面性(胜率72%)和多样性(胜率62%)依然超越朴素RAG。
上图第二、三行分别展示了GraphRAG和朴素RAG回答效果的对比;第四行是用LLM对这两个回答做的评估结果(四个维度)。
腾讯ima怎么把微信内容一键导入知识库?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
2026鸣潮账号交易安全指南:五大交易平台对比与风险避坑分析
腾讯ima怎么创建共享知识库?
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
Windy卫星云图怎么看?云层变化识别技巧
9条破亿视频,新号涨粉百万,过去半年谁在制造AI爆款?
结婚家电首选:Leader懒人三筒Ultra热泵洗烘一体
短剧《史上最强洪荒修为》剧情介绍
kimi提示词专家使用方法新手指南
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
如何修复Edge浏览器无法通过微软账号进行身份验证?
原神霜月三处月灵龛具体位置汇总
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc