热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >微软发布GraphRAG,碾压朴素RAG!

微软发布GraphRAG,碾压朴素RAG!

来源:互联网 更新时间:2026-08-15 14:58

全文长度:

3035字

预计阅读时间:

10分钟

Introduction

7月2日,微软正式发布了GraphRAG——一种基于图的检索增强生成方法,专门用于在私有或从未见过的数据集中进行问答。项目在GitHub上一经推出,立刻收获了2700颗星,热度可见一斑。先简单解释一下背景:检索增强生成(RAG)是当下很多大语言模型工具的核心组件,它的思路是根据用户的问题去搜索相关信息,再把搜索结果作为参考,让AI生成更靠谱的回答。常规做法是依赖向量相似性来搜索。

但问题在于,面对复杂文档,普通RAG往往力不从心。GraphRAG则另辟蹊径:它利用大语言模型自动生成知识图谱,从而大幅提升问答性能。这一改进基于近期在私有数据集中做提示词增强的研究成果。

  • 微软这里说的私有数据集,指的是那些大语言模型训练时没有见过、完全陌生的数据,比如某家企业的专有研究、商业文件或内部通讯。
  • 为了释放大语言模型在私有数据集上的潜力,GraphRAG在解决训练数据以外的问题时表现出了明显提升,为数据分析打开了新的大门。

GraphRAG的核心技术

GraphRAG的工作原理可以拆成两大块:知识图谱构建和社区检测算法。它通过大规模构建知识图谱,显著提升了对大型数据集的处理能力。

具体来说,方法就是让大语言模型从数据源中提取实体和关系,构建出知识图谱。然后这些图谱会被聚类到不同的相关实体社区中。真正执行RAG操作时,系统会遍历所有社区,生成“社区答案”,最后通过一个缩减过程汇总成最终答案。这样一来,大语言模型对私有数据集的理解和分析能力就上了一个台阶。

GraphRAG的流程

整个流程分两个阶段:先创建文本索引,再生成社区摘要。第一步是从源文档里抽取出实体知识图谱,然后为所有密切相关的实体组生成社区摘要。当用户提出问题时,系统会利用每个社区的摘要生成一部分回答,最后把所有部分回答拼成最终答案。

换个角度说,GraphRAG利用大语言模型构建基于图谱的文本索引:先提取实体知识图谱,再为密切相关的实体组生成社区摘要。面对特定问题时,系统逐个剪辑社区摘要,生成部分回答,再汇总成最终回答。

GraphRAG vs. 朴素RAG

GraphRAG在大语言模型处理私有数据方面的能力提升非常明显,尤其是在复杂语义推理上。相比之下,普通RAG在处理企业专有研究、商业文档等私有数据时效果很不理想。而GraphRAG结合了预先构建的知识图谱、社区分层、语义总结和图机器学习技术,在这些场景中性能大幅领先。

微软在博客中透露,他们在大规模播客和新闻数据集上做了测试,结果显示在全面性、多样性和准确性三个维度上,GraphRAG都优于朴素RAG,胜率达到了70%到80%。这个数据相当说明问题。

微软的GraphRAG特别适用

GraphRAG特别擅长回答那些需要整合整个数据集信息的问题。举个例子,如果问“数据中排行前五的主题是什么?”,基线RAG就会很尴尬:它依赖向量搜索去找语义相似的文本,但查询里没有提供能引导它找到正确信息的关键词。而GraphRAG完全不一样——由大语言模型生成的知识图谱本身就展示了整个数据集的结构和主题,私有数据集被组织成有意义的语义集群并提前做了总结。回答时,模型直接用这些聚类来汇总主题,效果自然好很多。

GraphRAG方法的优势

生成知识图谱相当于把整个文本集合拆解成更小、更易管理的社区模块,这扩展了模型的理解和生成能力。同时,通过生成社区摘要,模型能从整个数据集中萃取相关信息,回答更全面、更准确。而且GraphRAG在输出结果时会附上出处或源头信息,每个论断的引用来源都清清楚楚。用户可以直接对照原始材料,快速又准确地审核模型的输出,这一点对实际应用来说太重要了。

实际测试中的表现

在新闻数据集上,微软团队做了一个很有意思的对比。他们先问了一个简单问题:“Novorossiya是什么?”两个系统都能答好——这是基线RAG擅长的查询类型。但随后换了一个更有挑战性的问题:“Novorossiya做了什么?”结果基线RAG彻底失效了,因为检索的上下文窗口里没有出现“Novorossiya”这个词。而GraphRAG识别出了查询中的实体“Novorossiya”,以此为基础建立图谱,连接原始支持文本,最终生成了带出处的高质量答案。

总体来说,GraphRAG在大规模数据集上表现优越,处理复杂信息和提供全面答案方面的优势尤其突出。微软表示将继续在各类新领域中应用这项技术。

GraphRAG的应用场景

GraphRAG的应用潜力很广,可以覆盖企业的专有研究、商业文档、社交媒体数据等多种数据集类型。在具体应用中,它擅长做图谱上的实体检测与关系抽取,比如媒体分析和企业数据整理。

普通RAG处理企业专有研究和商业文档这类私有数据时效果欠佳,而GraphRAG通过知识图谱、社区分层、语义总结和图机器学习,能显著提升性能。为了验证效果,微软选取了VIINA数据集(新闻中暴力事件信息),这个数据集复杂、相互矛盾且信息不完整,非常贴近现实。而且内容相对较新,不在大语言模型的训练范围内,挑战性十足。团队把2023年6月俄乌双方新闻来源的上千篇报道翻译成英文,构建了一个专用数据集。由于数据太大,无法直接塞进大语言模型的上下文窗口,必须用RAG方法。

测试过程同上文所述:先问“Novorossiya是什么?”两个系统都表现良好;再问“Novorossiya做了什么?”基线RAG失败了,而GraphRAG通过实体识别和知识图谱连接原始文本,给出了带出处的答案。可见,GraphRAG利用大语言模型生成的知识图谱,显著提升了检索能力,提供了更高相关性的上下文和引用依据。

完整数据集推理

对于需要汇总全部数据集信息的查询,基线RAG表现很糟糕。比如“数据中排行前五的主题是什么?”这类问题,基线RAG因为缺乏关键词引导,找不对方向。而GraphRAG可以应对:知识图谱展示了数据集的整体结构和主题,私有数据集被组织成有意义的语义集群并做了预总结,回答起来游刃有余。

支持GraphRAG的基本流程

支撑GraphRAG的基础是一套基于图机器学习的研究和代码库。大语言模型处理全部私有数据集,为源数据中的所有实体和关系创建引用,然后利用这些引用构建知识图谱。接下来,通过生成的图谱自下而上地聚类数据,分层并组织成语义聚类。这种划分使得预总结语义概念和主题成为可能。通过构建知识图谱和社区结构,GraphRAG不仅帮模型理解文本,还把握了数据集的内在结构。结合大语言模型生成的知识图谱和图机器学习,它可以回答许多基线RAG无法单独解决的重要问题。

总之,GraphRAG在处理私有数据集方面表现出了显著改进,智能程度远超先前的方法。

写在最后

展望未来,GraphRAG有望带来多项技术突破。当然,它也有自己的挑战——比如资源需求和模型优化。微软在这方面投入了大量精力,取得的成果有目共睹,这也为我们展望大语言模型领域的未来趋势提供了重要参考。

当前大语言模型最大的挑战和机遇,在于如何把强大能力应用到训练数据以外的问题上,从未见过的数据中取得可对比的成果。GraphRAG为数据调查打开了新路:可以根据数据集的上下文和实际情况,自主确定其主题和语义概念。未来,这项技术将继续在各类新领域中拓展应用。

成本分析

从成本角度来看,GraphRAG并不占优势。目前它主要聚焦于局部检索能力——根据查询在向量库中匹配部分知识,再通过大语言模型合成检索到的信息生成回答。

技术优势

通过将大语言模型生成的知识图谱与图机器学习相结合,GraphRAG能够回答许多重要的问题类别,这些问题是基线RAG无法单独完成的。它拓展了模型的理解和生成能力,在处理数字化、社交媒体、新闻文章等资料时,能更有效地捕捉并利用数据中的复杂联系和交互。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc