热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >TRAD:通过步骤级示范检索和决策对齐来增强大型语言模型Agent的性能

TRAD:通过步骤级示范检索和决策对齐来增强大型语言模型Agent的性能

来源:互联网 更新时间:2026-07-30 13:52

如今,基于大语言模型的智能体(LLM Agent)已经遍地开花,从网页导航到在线购物,各种任务都能看到它们的身影。这很大程度上归功于LLM强大的知识储备和文本理解能力——通过上下文示例(in-context examples)就能快速泛化,连微调都不需要。不过,细看之下会发现,大多数研究把重点放在了“构建Agent”上,却很少有人认真琢磨:这些上下文示例该怎么选、怎么用,才能发挥最大效果?

最近有人提出了轨迹级检索的方法,把整条专家轨迹当作示例喂给Agent,在顺序决策任务上确实有所改善。但问题也随之而来:检索到的示例往往缺乏任务专属的状态转换细节,而且输入太长,塞进去大量不相关的上下文,反而成了噪声。这就像你让一个新手看一整段围棋高手对局的棋谱,但没告诉他当前局面下最关键的那几步该怎么走——信息太多,反而抓不住重点。

针对这个痛点,一个新框架

TRAD(Thought Retrieval and Aligned Decision)

应运而生。它做了两件事:第一步叫“思考检索”(Thought Retrieval),用“思考”(thought)来匹配示范步骤,而不是整条轨迹。这样一来,选出来的示范更有针对性,输入里的无关噪声也大大减少。第二步叫“对齐决策”(Aligned Decision),它会把检索到的示范步骤的前一步和后一步也补充进来——即使检索到的思考本身不够完美,也能通过上下文补齐信息,在“更多上下文”和“更少噪声”之间找到一个平衡点。这种方法对网页导航、在线购物这类需要按顺序做决策的任务特别有效。

图1:TRAD Agent(在ALFWorld环境中)的整体示意图

。TRAD首先对专家轨迹进行预处理,为每个步骤标记高质量的思考。在推理时,TRAD首先进行思考检索,该检索使用轨迹级别的检索示范作为查询和键值,以实现更精确的步骤级示范检索。给定检索到的步骤,TRAD使用对齐决策模块来补充它们的时间邻近步骤和相应的位置信息(

见图2

)。最后,根据增强的示范生成下一个动作。

TRAD:通过步骤级示范检索和决策对齐来增强大型语言模型Agent的性能

图2:对齐决策方法的一个示例

,其中? = ? = 1,且第?个检索到的步骤在其轨迹中位于时间??。对齐决策方法包括对检索到的步骤示范和提示的三个子过程:1)

时间扩展

:为每个检索到的步骤收集最多?个之前的步骤和?个后续步骤,并将每个步骤转换为从??−?到??+?的长度为?+?+1的序列;2)

相对顺序标记

:对于一个示范步骤序列中的每个步骤,我们标记其相对于该序列中检索到的步骤的相对位置,即前一个步骤(??−1)标记为[Step -1],下一个步骤(??+1)标记为[Step 1];3)

历史对齐

:对于当前情节,我们用?+?个之前的步骤(可选还包括思考)来补充当前观察,以丰富信息并与示范对齐。

在ALFWorld和Mind2Web两个标准测试集上,TRAD不仅全面超越了当前最先进的模型,而且有效降低了噪声干扰、提升了泛化能力。更值得一提的是,这套方法已经在一家全球商业保险公司落地,实际提升了机器人流程自动化的成功率。从实验到生产,这一步走得相当扎实。

ALFWorld与Mind2Web评测结果

比较Synapse基于任务元数据的轨迹级检索与TRAD基于思考的步骤级检索

(a) Synapse

的轨迹级检索仅考虑任务指令中的“搜索”,检索到的轨迹完全无关。然而,通过使用这些无关的轨迹生成思考,思考检索找到了与婴儿(幼儿)和导航相关的更相关的步骤级示范。

(b) Synapse

的轨迹级检索检索到的看似合理的例子并没有使用任务元数据在文本框中输入。尽管思考是不完美的,思考检索找到了更相关的示范,并且TRAD学会了输入“纽约”。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc