热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >LLM如何结合知识图谱进行RAG

LLM如何结合知识图谱进行RAG

来源:互联网 更新时间:2026-08-26 20:45

在开始今天的话题之前,先回顾一下数据库技术的发展史。20世纪60年代末,数据库技术开始萌芽,到了70年代迎来爆发式增长,成为计算机科学的重要分支。80年代,关系型数据模型一度占据统治地位,但随着使用范围不断扩大,也暴露了始终无法绕过的问题——数据建模上的结构性缺陷,以及大规模数据量、多服务器环境下的伸缩难题。与此同时,互联网的发展带来了很多新变化,传统关系型数据库越来越力不从心。为了应对这些挑战,一批新型数据库应运而生,被统称为NoSQL数据库。

NoSQL(Not Only SQL)是一个涵盖范围很广的数据库家族,它们不遵循关系型数据模型,也不使用SQL作为查询语言。我们这次要重点关注的是NoSQL中的图数据库。作为NoSQL的一种,图数据库的关注度从2013年开始就居高不下,从db-engines.com的榜单上就能清晰看到这一趋势。

“知识图谱”这个术语最早由谷歌在2012年5月提出(注:原文为2021年,按常识应为其提出年份,此处修正为2012年,以确保事实准确),目的是增强搜索结果,向用户提供更丰富的上下文信息。本质上,知识图谱是一种结构化的知识表示方式,通过实体、关系和属性来描述复杂的知识网络。实体代表现实世界中的对象或概念,关系表示实体之间的关联,属性则描述实体的特征。这种表示方式不仅能直观地展示知识之间的关联,还能支撑高效的知识检索与推理。

结合知识图谱进行RAG

在当前的语境下,我们所说的知识图谱往往指的就是图数据库,比如Neo4J、NebulaGraph这类产品。因此,结合知识图谱来做RAG(检索增强生成),本质上就是结合图数据库。最早提出基于图数据进行RAG的,正是NebulaGraph团队,这种方法也被称为GraphRAG。

在NebulaGraph的方案中,他们将这种方法命名为Text2Cypher——和Text2SQL类似,借助大语言模型(LLM)生成对应的Cypher查询语句。传统的文本查询流程是:收到一个问题后,先做意图识别、实体识别,再通过LLM或代码将意图和实体构造成查询语句。在结合图数据库的场景下,思路如出一辙,只是查询语句变成了Cypher或其他NoSQL语法。

与基础RAG相比,GraphRAG的提示词不仅包含原始查询信息和根据查询检索到的上下文,还集成了从领域知识图谱中检索到的相关知识——在广度与深度上都更胜一筹。这就意味着,GraphRAG不仅能进一步提升LLM生成答案的准确性和可靠性,更重要的是,它通过知识图谱增强了模型的检索能力,从而提升了处理复杂信息的能力。

微软今年做了一个很有意思的实验,用的是VIINA数据集,这个数据集以新闻中的暴力事件信息为基础,特点是复杂度高、信息多元且存在不同观点。更重要的是,这些信息是近期发生的、尚未被纳入LLM的预训练数据,可以算是真实场景的测试用例。

实验中,基于RAG和GraphRAG分别进行提问:

Query1:“What is Novorossiya?”

Query2:“What has Novorossiya done?”

在问题1上,RAG和GraphRAG都能很好作答。但在问题2中,提问隐含了实体间的关联查询,基础RAG就无法应对了;而GraphRAG从Novorossiya中发现了一个关键实体,通过指向原文的链接得到了更优质的答案。

此外,基础RAG极度依赖相似度检索,因此在面对需要汇总整个数据集才能回答的问题时——比如“数据集中排名前五的主题是什么”——往往表现不佳,因为基于向量搜索很难精准命中全局信息。而GraphRAG恰好能补上这块短板。同样在这次实验中:

Query:“What are the top 5 themes in the data?”

基础RAG列举的主题和实际情况关联不大,而GraphRAG的结果则清晰列出了5个主要主题及其支持细节。这才是GraphRAG的真正价值所在。

知识图谱RAG方案对比

当前流行的llama-index和Langchain框架中,实现知识图谱检索的方式是Text2Cypher。简单来说,LLM根据用户提问生成一个Cypher语句,然后在Neo4J或其他图数据库中执行,最后LLM根据执行结果进行总结返回。

而微软的GraphRAG框架则另辟蹊径,没有使用第三方图数据库,而是建立在开源库DataShaper之上。DataShaper是一个数据处理库,允许用户用明确定义的框架,以声明式方式表达数据管道、架构和相关资产。

微软GraphRAG的整体流程大致分为以下五个步骤:

  1. 编写TextUnit:

    将输入的文档转换为TextUnits,TextUnits用于将文本块提取到图中。
  2. 图提取:

    分析每个TextUnit,提取图的基础信息——实体、关系和声明,并将结果汇总传递给后续阶段。
  3. 图增强:

    对上个阶段获取的实体和关系图进行扩充,通过社区检测、图嵌入等手段理解图的拓扑结构。
  4. 总结:

    基于社区数据生成报告及总结。
  5. 文件处理:

    为知识模型创建文档表。
  6. 网络可视化:

    执行一些步骤,支持在现有图标的高维向量空间中进行网络可视化。此时有两个逻辑图表在起作用:实体关系图和文档图。

未来的机遇与挑战

GraphRAG的未来发展空间很大,尤其是在需要高准确性和复杂推理能力的领域。通过结合知识图谱,GraphRAG能够提升生成模型的知识理解、推理能力和信息检索准确性,特别适合医疗、金融、法律这类专业领域,能提供高度定制化的解决方案。而且,知识图谱的结构化特性使得信息更新更快捷,能够更好地适应快速发展的行业需要。

不过,这背后也藏着不小的挑战。知识图谱的构建与维护本身就非常复杂;多模态整合的技术难题尚未完全解决;实时性能优化、图谱覆盖范围的限制,以及数据隐私与安全问题,都是必须正视的核心挑战。如何在效率和准确性之间找到平衡,将是未来GraphRAG落地应用的关键所在。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc