来源:互联网 更新时间:2026-08-20 14:43
思维链和思维树这类提示技术,确实让大模型在复杂推理任务上的表现提升了不少。说白了,就是逼着模型一步步地思考——从A到B再到C。可问题是,人类真实的思维过程哪有这么线性?我们常常会同时展开多条思路,甚至把不同方向的见解杂糅到一起,最后拼出一个答案。那如果把推理过程画成一张图,而不是一条链或一棵树,是不是更能贴近这种非线性的思考方式?这正是本文要讨论的核心。
常见的提示技术,有基础的提示工程、上下文窗口、提示结构这些,也有进阶的思维链(CoT)、思维树(ToT)、自我一致性(self-consistency)等等。不过,要深入理解后文提到的图结构推理,还得先回顾一下Transformer的基础,以及图卷积网络是怎么处理图数据的。下面就从Transformer讲起。
Transformer最初是为序列到序列任务设计的,比如语言翻译。但后来人们发现,这个架构和它的各种变体几乎能搞定所有事儿:
Vision Transformer:用于图像的目标检测和分类
Encoder-only Transformer:例如,面向区分性语言任务的仅编码器Transformer
Decoder-only Transformer:例如,语言建模的仅解码器Transformer
在Transformer之前,不同的任务得用不同的深度学习架构。但Transformer牛就牛在,一个架构通吃各种任务。
编码器-解码器Transformer由两个部分组成:
编码器:每个块包含双向、多头自注意力和前馈变换(通常是一个两层前馈网络)。
解码器:每个块包含掩码自注意力、交叉注意力和前馈变换。
处理原始文本时,文本被转换成一系列向量,每个向量都带上了位置信息,对应输入中的每个token。这个向量序列被编码器吃掉,输出也是一串token向量,只是经过了双向自注意和前馈网络的转换。这串向量经过编码器所有块的处理后,就成了解码器的输入。简单说,编码器通过双向自注意形成对整个输入序列的表示——也就是说,在生成输出序列时,每个token都会参考序列中所有其他token。
接着,解码器拿着编码器的输出,在生成输出时把输入序列的这种表示当作上下文。Transformer的解码部分和编码器长得像,但有两个关键区别:
它用的是掩码自注意力。
它多了一个交叉注意力机制。
掩码自注意力限制了解码器中的多头自注意力操作,不允许在序列中“向前看”。换句话说,每个token的表示只依赖它前面的token。
原因很简单:解码器要生成一个文本序列作为输出。如果它也搞双向自注意,模型在训练时就能提前看到正确的下一个token,然后直接复制过来“作弊”。掩码自注意力避免了这个问题,让模型可以通过预测下一个token来老老实实地训练出连贯的文本。交叉注意力跟普通的注意力操作类似,但它把编码器和解码器两个独立的序列融合到了一个注意力操作里。
标准的编码器-解码器Transformer架构,一个广泛使用的例子是T5模型。它主要用于自然语言的迁移学习任务,无论是Seq2Seq任务还是前缀语言建模任务,都很实用。
两个重要的变体是仅编码器和仅解码器模型。纯编码器架构只保留Transformer的编码器部分,完全砍掉解码器。这种架构被BERT带火,在微调各种区分性语言任务(比如句子分类、命名实体识别、问答等)时非常高效。
仅解码器架构则只砍掉编码器部分。这意味着所有交叉注意力模块也得跟着移除,所以纯解码器Transformer的每个块只做掩码自注意力和前馈变换。目前被广泛研究的大多数生成型LLM,比如GPT系列、Falcon、LLaMA-2等,用的都是仅解码器架构。
既然我们的目标是利用图数据结构对推理过程建模的提示技术,那就有必要了解一下机器学习中通常怎么处理图结构数据。大多数模型结构(比如Transformer或卷积神经网络)是为处理欧几里得数据设计的——图像、文本这类可以用矩阵轻松表示的东西。但并非所有数据都能线性表达。事实上,很多真实世界的数据源更适合建模成图,比如社交网络、分子结构等。对于这类数据,一般用的是一种叫图卷积网络(GCN)的特殊模型。

从核心组件上看,GCN和典型的前馈神经网络差别不大。给定一个图,我们把每个节点和一个输入嵌入关联起来——这个嵌入可以来自多种数据源(比如文档的嵌入、用户对应的特征等)。然后,在GCN的每一层,首先对每个节点的嵌入(经过归一化)做前馈变换。接着,通过聚合每个节点的相邻特征来融入图的结构——比如取所有相邻节点嵌入的平均值。通过叠加多层GCN,我们可以学到丰富的节点表示,既能捕获每个节点的属性,又能捕获图的结构。
GCN架构已经非常流行,被广泛应用在各种大型应用中(比如Google Maps)。而且它还有不少扩展,一个值得关注的架构是图注意力网络(GAT)。
GAT架构和GCN有点类似,但它不是简单地用平均值来聚合相邻节点的特征。相反,它用加权平均来融合相邻节点特征,而权重是通过注意力机制算出来的。这个注意力机制可以很简单——比如把两个相连的节点嵌入作为输入,执行一次前馈变换来计算分数。这种方法能学到更一般化的相邻特征聚合方式。
还有一种提示技术值得留意——多模态思维链。这个方法提出了一个两阶段的解决方案,专门处理有文本和视觉输入的推理任务。第一阶段,模型把文本和图像同时作为输入,生成一个类似思维链的合理解释。然后,这个合理解释和原始输入拼在一起,再塞进模型(连同图像)输出最终答案。该方法基于T5架构,并在它要解决的任务上做了微调。
尽管CoT提示的影响力惊人,但它有自身的局限:它用从左到右的方式生成问题解决原理,一旦推理过程中间出现早期错误,模型没办法回头纠正。思维树(ToT)提示提供了一个解决方案——它支持对建模为树的中间推理步骤进行回溯和策略性的前瞻。但即便ToT很实用,它仍然把推理和问题解决当作一个线性过程,只是在树中的单一路径上走,这限制了提示技术的能力。
如果把思维单元表示为节点,思维之间的联系表示为边,就能捕捉人类思维的非顺序性质,让思维过程的建模更贴近现实。
GOTR是一个两阶段的推理框架,全称“思维图推理”,专门解决带文本和视觉输入的推理任务。第一阶段,语言模型被用来生成一个解决问题的合理解释。第二阶段,这个合理解释被用来得出最终答案。这个两阶段的过程受到了多模态CoT的启发。
GOTR框架在推理过程中依赖三种不同的输入:
文本:任何基于提示的推理任务中获得的正常文本输入。
图像:可以(可选地)摄入与推理任务相关的图像。
思维图:生成一个包含输入文本中所有命名实体及其关系的图。
每种输入在架构中都有单独的编码器。然后,这些编码器生成的表示被融合在一起,传递给能够生成输出的解码器模块——要么是合理解释,要么是最终答案。
GOTR在两个阶段中运行。第一阶段,针对待解决问题的输入文本,期望生成一个类似思维链的合理解释。然后,第一阶段的合理解释与输入文本拼接起来,再次生成输出。第一阶段和第二阶段的唯一区别是:第二阶段的输入更长(即输入文本+原理),而且第二阶段产生的是最终答案,而不是合理解释。除此之外,两个阶段的结构完全相同。下面描述了GOTR在两个阶段中的流程,每个阶段都会产生两种不同的输出。
如前所述,GOTR采用三种数据源作为输入:文本、图像和思维图。图像是完全可选的,没有它GOTR也能正常工作。其中,思维图是基于输入文本构建的,示例如下:
具体来说,GOTR的思维图用于表示输入文本中的命名实体及其关系。为了生成这个图,需要使用工具(比如CoreNLP框架)从文本中提取三元组,并执行共享引用解析来统一重复实体,从而形成输入文本的图表示。
为了从不同的输入模式(文本、图像、图)中获取数据,每个模式都有单独的编码器。对于图像和文本数据,可以直接用Transformer编码器,或者对图像用视觉Transformer编码,文本用T5模型的编码器编码。
与大多数LLM不同,GOTR框架采用了不同的模型架构。它不是典型的仅解码器架构,而是使用基于前缀的语言建模方法——用多个编码器模型来摄入输入,然后把这些编码器的输出传递给解码器以生成输出。这类似于编码器-解码器Transformer,但可以有多种不同类型的编码器。为了使用多个编码器,需要在解码器之前添加几个学习层,这些层把它们的输出融合成一个单一序列,再传给解码器。GOTR在所需任务上用完整的编码器-解码器设置进行了微调。
GAT是GCN架构的一种类型。它不是通过简单的求和/平均来聚合相邻节点的特征,而是使用注意力机制来聚合相邻节点之间的信息。
一旦文本、图像和思维图的输入数据都被编码,就需要在把这些特征传递给解码器之前将它们融合在一起,以生成输出。一个简单的做法是先用交叉注意力机制。这个初始的特征融合操作如下所示:文本特征与图像特征和思维图特征通过交叉注意力融合。这里图像特征是可选的。
交叉注意力之后,仍然有文本特征、图像特征(如果有的话),需要把这些特征组合成一个单一表示,才能传递给解码器。这一步可以通过门控融合层完成。具体来说:
取出输入特征
将它们乘以一些可学习的权重矩阵
产生“掩码”(即每个条目值在0到1之间的矩阵),告诉模型保留或去除每个特征的哪些部分。
当把GOTR产生的合理解释与其他框架比较时,会发现GOTR在ROUGE得分上生成了质量更高的合理解释。与多模态CoT和UnifiedQA方法相比,质量略有提升——这似乎说明,把思维图纳入问题解决过程确实有帮助。
GOTR严格来说并不是一个纯粹的提示技术——它需要微调或训练才能解决推理问题。而CoT或类似提示的方法,用的是预训练好的LLM,不需要任何模型微调。“思维图”(GoT)提示,则把LLM生成的每一个想法建模成图中的一个节点,用连接这些节点的边来表示依赖关系。
人类在解决问题时不会死磕一条思维链,而是可能同时尝试多条思路,并把不同思路的见解结合起来。第一种情况可以用ToT提示来处理,但把不同思维链结合起来,树形结构就有点力不从心了。图结构则可以把多条推理路径合并在一起。而且,这种结构还能捕捉类似递归的模式,对解决各种不同的问题可能很有价值。GoT可以扩展,让不同大模型即插即用,提示技术也变得更容易。
GoT框架把LLM的推理过程表示成一个有向图。图中的每个节点对应LLM生成的单个想法,边表示想法之间的关系。也就是说,从想法a到b的边(a→b)只告诉我们:想法b是用想法a作为输入生成的。与ToT提示类似,想法的具体定义取决于正在解决的问题。更进一步,每个节点可以代表一个问题或中间问题的解决方案,但图中可以有不同类型的节点,代表推理过程的不同方面(比如计划与执行)。
假设我们用图来表示LLM执行的推理过程,那么对这个图的任何修改都意味着对底层推理过程的修改——这些修改被称为思维变换,具体定义为向图中添加新的顶点或边。如上图所示,存在各种思维变换,比如合并或分割数组中的数字、汇总一组文章、生成单篇文章的多个摘要,等等。总体上,有三种主要的思维变换类型:
聚合:把任意多个想法聚合成一个新想法。
精炼:通过自我连接来精炼想法中的内容。
生成:基于一个想法生成多个新想法。
每一种类型都可以任意地修改和推进LLM的推理过程。例如,聚合可以把多个不同思维链的结果合并在一起,而精炼可以递归地更新一个想法,直到得到最终答案。这样的功能严格扩展了CoT和ToT的提示技术。
最后,GoT提示使用评估函数为特定的想法分配分数,以及一个排名函数来选择最相关的想法。值得注意的是,排名和得分都考虑了整个图结构。排名通常只是返回得分最高的想法。
其中主要的模块如下:
Prompter:为LLM准备消息或提示词,应该包含图结构的编码。
Parser:从LLM输出中提取相关信息,形成存储在每个想法中的状态。
Scorer:验证想法状态是否满足正确性条件,并分配评分(从LLM或人工标注中获得)。
Controller:协调推理过程,决定下一步怎么做。
Controller会选择应该应用于底层图结构的思维变换,把信息传达给Prompter,并根据Scorer对生成的想法状态的输出来判断推理过程是否已经完成,或者应该继续向前。在整个过程中,Controller维护两种信息:
操作图:在推理过程之前创建的用户定义的静态结构,捕获思维操作的执行计划。
图推理状态:一个跟踪LLM推理过程状态的动态结构,包含所有想法及其状态。
GoT提示技术的常见示例包括:用归并算法对数字列表(含重复数字)排序、计算两个集合的交集、关键字计数以及文档合并等。与其他提示技术相比,GoT提示的延迟更低、容量更大,而且持续产生的错误更少。这些结果如下图所示。
不过,GoT和其他提示技术之间的性能差异在现实世界的任务中似乎没那么明显。例如,在文档合并任务上,GoT提示的改进并不大。同样,在关键字计数任务上,GoT虽然有一定优势,但基线技术——尤其是ToT提示——也相当有竞争力。
在考虑是否在实践中使用GoT时,需要问自己两个问题:
要解决的问题是否能轻易分解成更小的、可解决的子问题,然后再合并成最终方案?对于这类(基于合并的)问题,GoT提示非常有效。
增加的成本是否成了问题?能不能用更便捷的技术(比如CoT提示)就得到一个合理的解决方案?
从链到树再到图,是一个很自然的演进过程。基于图的提示技术让大模型能把自己的推理过程构造成图结构。从线性推理转向更灵活的图结构推理,对某些任务确实很有好处——GOTR和GoT提供了两种参考示例,可以看到图结构有利于推理过程。不过,由此产生的推理过程也可能更复杂、更昂贵。
腾讯ima怎么把微信内容一键导入知识库?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
腾讯ima怎么创建共享知识库?
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
WorkBuddy微信版怎么获得积分?
车载冰箱重置到出厂设置几步?
短剧《史上最强洪荒修为》剧情介绍
TRUMP价格走势与WEPE预售进展解析
结婚家电首选:Leader懒人三筒Ultra热泵洗烘一体
腾讯ima知识库怎么分类管理?
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
短剧《仙人跳获透视,古玩玉器我全拿捏》剧情介绍
Windy卫星云图怎么看?云层变化识别技巧
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc