热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >大模型构建和推理知识图谱的能力究竟几何?

大模型构建和推理知识图谱的能力究竟几何?

来源:互联网 更新时间:2026-08-23 13:53

之前我们用了三期内容,把传统知识图谱自动构建过程中,尤其是从非结构化或半结构化数据里做“知识获取”的核心技术,捋了一遍。那些方法主要依靠统计模型和深度学习,重点在于怎么把实体、关系从文本里抽出来。 今天这篇,我们往前走一步——借一篇2023年的论文《LLMs for Knowledge Graph Construction and Reasoning: Recent Capabilities and Future Opportunities》,来认真讨论一个现实问题:**用大语言模型(LLM)来做知识图谱的自动构建和推理,到底靠不靠谱,又该怎么落地。** 先说几个核心判断:第一,作者在八个不同的数据集上做了系统实验,重点考察了实体关系抽取、事件抽取、链接预测和问答这四个代表性任务,全面检验了LLM在知识图谱构建与推理上的表现。第二,他们还设计了一个很有意思的“虚拟知识提取”任务,用来测试LLM的泛化能力,并配套构建了VINE数据集。第三,最后提出了一套基于多智能体的自动化知识图谱构建与推理方法——AutoKG。

研究背景和目的

知识图谱本质上是由实体、概念和关系编织起来的语义网络。构建一套可用的知识图谱,往往涉及命名实体识别、关系提取、事件提取、实体链接等多个工序。而链接预测是推理环节的关键任务,决定了最终构建出来的图谱能不能用、好不好用。另一方面,知识图谱在问答场景里也扮演着中心角色——尤其是在需要多跳推理的时候。 所以,这篇论文的目标非常明确:系统性地搞清楚LLM在知识图谱构建和推理任务中到底能干什么、不能干什么。具体来说,集中在以下三个方面: 1. **能力评估**:在不同的数据集上,测试LLM在零样本和单样本设定下的表现,看它们在知识图谱领域有没有实际价值。 2. **泛化能力分析**:通过设计“虚拟知识提取”这个新型任务,判断LLM是真的掌握了理解与推理能力,还是只靠记忆在硬撑。 3. **AutoKG的提出**:基于实验结果,提出一个多智能体协作框架,让LLM之间互相配合、自动完成任务,减少人工干预,同时提高复杂场景下的适应性和准确性。 必须指出,论文中提到的“事件提取”可能不是知识图谱构建的常规任务。但事件信息确实可以在知识表示、关系识别、上下文理解、领域应用等多个层面发挥作用,所以也不能忽视它的价值。

LLM的能力评估

实验设置

针对前面提到的四个任务,作者在零样本和单样本设定下,分别测试了GPT-4、ChatGPT和text-da vinci-003这三个模型。每种任务都选了完全监督的SOTA模型作为基准。数据集的选择也很有针对性: - **实体和关系抽取**:用了DuIE2.0、SciERC、Re-TACRED和MA VEN四个数据集,每个数据集随机抽取20个样本,覆盖所有关系类型。 - **事件提取**:同样使用MA VEN数据集,抽取20个样本,用F分数评估性能。 - **链接预测**:选了FB15K-237和ATOMIC 2020,FB15K-237抽25个样本,ATOMIC 2020抽23个样本。 - **问答任务**:用FreebaseQA和MetaQA,各抽20个实例,评估指标是AnswerExactMatch。 需要坦诚地说,仅从每个数据集中抽取20个左右的样本,样本量确实偏小。但作者在文末的局限性部分也做了说明——当时无法使用GPT-4的API,只能通过交互界面手动做实验,时间成本和工作量都非常大。

实验结果

先看整体结论(见左下图):尽管当下的舆论确实时常把LLM捧上天,但实验数据很清楚——在零样本和单样本设定下,LLM在知识图谱构建任务上并没有超越当前最先进的监督模型。这说明,LLM从稀疏数据中提取信息的能力依然有限。 但在推理任务上,情况完全不同。FreebaseQA(问答)和FB15K-237(链接预测)这两个数据集上,所有LLM在零样本设定下、GPT-4在单样本设定下的表现,都已经达到或接近SOTA。这种构建与推理之间的性能差距,可能反映了构建任务本身更高的内在复杂度;而推理任务的亮眼表现,也很可能得益于LLM在预训练阶段接触过的大量相关知识。
具体来看: - **实体和关系抽取**:GPT-4在零样本和单样本下表现相对最好,但依然远不及完全监督的小模型(见右上表)。 - **事件检测**:LLM整体落后于精心训练的小模型;不过GPT-4在同时识别多个事件类型方面,显示出一些不一致但确实存在的优势。 - **链接预测**:GPT-4在零样本下的表现接近最佳水平;而在单样本场景下,通过优化指令文本可以进一步拉升性能(见下表)。 - **问答任务**:GPT-4在零样本下表现与ChatGPT持平,双双超过SOTA模型。有趣的是,进入单样本场景后,只有text-da vinci-003从中受益,ChatGPT和GPT-4的性能反而有所回退(见上表)。

对实验结果的讨论

(一)通用与专用领域的表现

作者专门对比了SciERC和Re-TACRED两个数据集——都用于关系抽取,但前者偏科学领域,后者偏通用。结果发现,LLM在特定领域数据集上的表现明显更弱。这很可能是因为模型主要在广泛的通用语料上训练,缺少足够的领域专业知识。

(二)性能不足的原因

为什么LLM在构建任务上表现不佳?作者做了几个方向的推测: - **数据集质量**:数据集本身有噪声,复杂的上下文和潜在的标签错误都会干扰评估结果。 - **提示词质量**:指令设计是否精准,直接影响了模型的理解与输出。 - **评估方法**:现有评估方式可能不完全适合ChatGPT和GPT-4这样的模型。数据集标签不一定能涵盖所有正确的回答,同义词处理就很典型——比如标签里标注的是“Capital”,模型却输出了“Metropolis”(一样表示首都),但评估系统可能直接判定为错误。

(三)模型是否真正具备泛化能力

这个问题的本质是:LLM在推理中的出色表现,到底是源于它背下了海量知识,还是因为它真正具备了泛化能力?为了回答这个问题,作者设计了“虚拟知识提取”任务。核心思路是:构造一批不存在的实体和关系,看LLM能不能从指令中学会提取这些全新的知识。 实验结果很有意思:GPT-4在这个测试中成功提取了80%的虚拟三元组,而ChatGPT的准确率只有27%。这组数据说明,GPT-4确实具备较强的指令学习和泛化能力,并非单纯依赖对相关知识的记忆。

AutoKG的提出

提出背景

在通用领域,LLM的确展现了比小模型更强的适应性和泛化能力。但问题也很明确:LLM容易产生“幻觉”,生成的信息可能不准确;同时,作为“黑箱”模型,它的决策过程不透明,影响了知识图谱构建的可解释性和准确性。 所以作者提出了一个多智能体框架——**AutoKG**。核心思路是:给不同的智能体分配不同的角色,让它们基于各自掌握的“知识”协作完成任务,而不是依赖单一模型的全局判断。

AutoKG工作流程

具体架构如下图所示:不同智能体承担不同角色——比如,KG助理智能体作为咨询方,KG用户智能体作为领域专家。它们接收与知识图谱构建或推理相关的提示,然后按指引行动。 在收到提示和角色分配后,任务指定智能体负责澄清概念、提供详细描述。之后,KG助手和KG用户通过多轮对话配合完成指定任务,直到KG用户确认任务顺利完成。 值得关注的是,框架中还引入了一个“网络搜索者”角色,专门负责帮KG助手做互联网知识检索。整个协作流程是:KG助手收到KG用户的对话后,先询问网络搜索者是否需要上网查一下;根据搜索者的反馈,再进一步处理用户的指令。实验结果表明,多智能体协作加上互联网增强的方法,确实能更全面、更有效地构建知识图谱。

三个显著挑战

尽管AutoKG显著提升了LLM构建知识图谱的效果,但在实际使用中,还有三个比较明显的瓶颈: 1. **API的Token限制问题**:当时使用的是gpt-3.5-turbo,最大Token限制影响了处理长文本或复杂查询的能力。 2. **人机交互的效率问题**:完全自动化操作缺少人类监督,无法即时纠错;但如果每一步都加入人工参与,时间和劳动成本又会大幅上升。这个平衡点很难找。 3. **LLM的幻觉问题**:模型生成非事实信息的倾向依然存在,输出的内容需要仔细核查。目前可行的做法包括:与标准答案比对、专家审查、或者引入半自动化验证算法。

研究局限性

研究本身的局限性,作者自己已经很坦诚地列出了几条: - 由于无法使用GPT-4 API,只能通过交互界面做实验,工作量和时间成本远超预期; - 实验只选了GPT系列模型,没有考虑LaMDA等其他大模型; - 知识图谱构建与推理涉及的任务非常丰富,而研究只涵盖了少数几个代表性任务,结论的普适性需要进一步验证; - LLM本身存在固有偏见和事实准确性问题,所有实验结果都应当用批判性思维来看待。

未来发展

论文也提出了几个值得继续跟进的方向。比如把研究范围扩展到更多的LLM模型,探索知识图谱相关的更多任务——尤其是多模态推理。另外,假如后续能够拿到GPT-4的API访问权限,研究者也很想进一步挖掘它在多模态处理上的表现潜力。
关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc