来源:互联网 更新时间:2026-08-21 14:40
大家都有过这种体会吧——比起死记硬背知识点,把知识整理成清晰的脉络往往能让学习事半功倍。大模型其实也一样。就算允许它“开卷作答”,也就是通过检索增强(RAG)技术从知识库里把相关材料捞出来当参考,可真碰上复杂问题,RAG的增益效果还是不太理想。毕竟,谁能保证开卷考试就一定拿满分呢?
正因为这样,我们才希望给大模型的思考过程注入一些类似知识框架的方法指导。而已经发展多年、逐渐成熟的知识图谱(KG),或许正是破局的关键。
在当下的大模型研究中,RAG技术的出现确实为知识缺陷和幻觉问题提供了一剂良方——通过动态检索外部信息,大模型的能力被拔高了一个台阶,不再囿于静态训练数据的边界。然而,即便RAG系统在知识预处理、细粒度检索、生成思维链等方面做了各种花哨的优化,大模型在构建类似人类那种对复杂任务的洞察力上,依然力不从心。这类任务往往需要持续且有目的地去理解对象、数字、概念和事件之间的关联,才能预判走势并有效行动。
更关键的是,多数RAG系统严重依赖文本向量的相似度来检索,这导致它们在理解长距离的跨类型知识关联时,暴露出几个硬伤:
面对这些挑战,本文提出了Think-on-Graph 2.0(ToG2.0),用知识图谱引导的知识检索来实现深度、可解释的推理。ToG2.0把文档中的非结构化知识和知识图谱里的结构化洞察揉在一起,相当于给复杂问题解决能力铺了一张路线图。通过把问题对齐到知识图谱,并把图谱当作导航工具,它深化和细化了RAG范式:既保证了语义相似性上的事实一致性,又促进了逻辑一致性上的长距离关联。这套范式让大模型在推理和解决问题时更接近人类——先检查当前线索,再依据自身知识框架关联潜在实体,一层层深入直到找到答案。
在RAG系统里,检索数据的粒度是个关键因素。粗粒度的检索单元理论上能提供更多相关信息,但多余的内容也容易分散检索器和生成器的注意力。反过来,细粒度的检索单元虽然让生成器轻松了,却把压力抛给了检索器,还很难保证语义完整性和所需知识不缺失。
跟纯语义检索不同,知识图谱提供的是动态、明确且结构化的知识表示,这种结构化为大模型能访问的知识引入了可解释性和精确度。近期的研究尝试过把图谱中的结构化知识转换成文本提示来增强大模型,但碰到了一些独特的限制——比如三元组提供的信息缺乏深度和细节。加上知识图谱本身的不完整性,甚至可能丢信息。
下图展示了传统RAG(a)、纯KG增强生成(b)和ToG2.0(c)的对比。这个例子清楚说明了纯语义检索和纯知识图增强框架在复杂QA任务里的短板,以及本文“KG+RAG”框架的优势所在:
ToG2.0初始化阶段的核心任务,是为特定查询选对起点,这样才能让后面的推理更顺畅。打个比方,查询“腾讯公司的创始人中,谁曾是全国人民代表大会的成员?”——如果起点选得太宽或者没选好,比如直接拿“全国人民代表大会的成员”下手,那可就掉进海量无关数据的筛选陷阱里了,费时费力还不聚焦。有效的起点应该盯住“腾讯公司的创始人”这类实体。这个原则在推理任务里至关重要,尤其开放领域问答中问题五花八门,选对起点就更关键了。
因此,面对一个问题,ToG2.0先执行实体识别和主题修剪(TP),让大模型评估问题中间出现的实体,从中挑出一组适合当起点的主题实体。在复杂推理中,问题与有效中间线索句子之间的隐含关联,稀疏或密集向量检索模型往往识别不出来。为打破这个局限,ToG2.0提示大模型基于当前上下文,为每个主题实体生成线索查询问题,给下一步探索实体关系和上下文指了个方向。
还是拿上面那个问题举例:基于“全国人民代表大会”这个实体,大模型可能会生成一个线索查询,建议收集这些人关于整治身份或隶属关系的信息。这样,ToG2.0就能更高效地引导大模型在知识图谱里做有针对性的探索,推理的准确性和效率自然就上去了。
ToG2.0的推理过程靠图驱动的知识检索来实现,迭代地利用结构化和非结构化知识来推进。具体说,在第次迭代中,给定原始问题、第次迭代的线索查询,以及主题实体和前面的三元组路径(其中),每次迭代包括三步:关系修剪(RP)、实体修剪(EP)和检查与推理(ER)。

本文选了四个数据集来测ToG2.0的效果:两个多跳知识库问答数据集WebQSP和QALD-10-en,一个多跳复杂文档问答数据集HotpotQA,还有一个事实验证数据集FEVER。FEVER用准确率(Accuracy)评估;WebQSP、HotpotQA和QALD-10-en则用精确匹配(Exact Match, EM)。
基线方法包括:
跟上面这些基线——包括标准提示、CoT、CoK以及原版ToG——一比,ToG2.0的优势相当明显。具体说,ToG2.0在WebQSP、HotpotQA和QALD-10-en上都压过了所有基线。特别值得注意的是,在HotpotQA上,ToG2.0不仅全面领先,还比当前最强的基线CoK高出了5.51%的性能提升。相比原版ToG,ToG2.0在HotpotQA上涨了14.6%,在WebQSP上提升了4.93%,在QALD-10-en上提升了3.85%,在FEVER上提升了5.84%。
虽说在FEVER上,ToG2.0的准确率略低于CoK——但差异可能是因为CoK用了更多知识源,外加额外的LLM自我验证机制。为了降低计算成本和推理延迟,本文没使用自我验证机制,不过也说了,未来完全可以根据应用需求调整。
另外,消融实验用来评估每个组件的贡献。结果显示,主题修剪(TP)在WebQSP上效果尤其突出——估计是因为WebQSP的问题里包含更多一般性实体,容易引入不必要的噪声。关系修剪(RC)虽然可能会略微降低性能(因为它在单个提示里给大模型塞了更多任务,理解起来更费劲),但好处是大幅减少了推理次数和延迟。线索查询在每个数据集上都带来了相对一致的改进,说明适应性查询优化确实能帮大模型更好地理解任务。

本文还额外测试了把ToG2.0用在弱一些的LLM(比如Llama-2-13B)上。结果表明,ToG2.0对这些弱模型的提升更大——这说明它的适应性可能更强。弱模型处理复杂任务时常遇到瓶颈,而ToG2.0通过知识图谱做线索,优化推理路径、降低任务复杂度,再用实体上下文引导模型关注相关信息,从而提高了理解和回答的准确率。相比之下,像GPT-3.5这样的强模型本来就已经接近性能上限,所以提升反而不那么明显。
ToG2.0把结构化的知识图谱和非结构化的文档信息结合了起来,集众家之长,显著提升了LLM的推理能力。这就好比给一个超级聪明、特别会总结知识框架的学生,配了个装满各种书籍和资料的图书馆——那可想而知,他要再学不好才怪呢。
鉴于ToG2.0在系统化推理能力上的巨大增益潜力,随着未来LLM推理和理解能力的同步发展,说不定通过ToG2.0或类似技术加持的LLM,能更快地落地到医疗咨询、法律分析、教育辅导等更复杂也更专业的任务中。
总的来说,图与RAG的结合这个方向,从最近GitHub上各种Graph RAG方案飙升的星数就能看出来,大家对这个话题的热情相当高。不过话说回来,图的构建本身就是一个比较重的活儿,而且对准确率非常敏感;之前传统RAG之所以能流行起来,靠的是跟LLM搭配后那种“简单粗暴、方便好用”的效果。所以,怎么在两者之间权衡和取舍,可能也是未来研究中需要持续思考的问题。

腾讯ima怎么把微信内容一键导入知识库?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
腾讯ima怎么创建共享知识库?
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
WorkBuddy微信版怎么获得积分?
5000元起的鼠标哪个最值得入手?
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
车载冰箱重置到出厂设置几步?
短剧《史上最强洪荒修为》剧情介绍
kimi提示词专家使用方法新手指南
结婚家电首选:Leader懒人三筒Ultra热泵洗烘一体
腾讯ima知识库怎么分类管理?
短剧《仙人跳获透视,古玩玉器我全拿捏》剧情介绍
Windy卫星云图怎么看?云层变化识别技巧
一加手机如何设置三指长按屏幕局部截图
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc