热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >如何让agent自主学习技能?

如何让agent自主学习技能?

来源:互联网 更新时间:2026-08-12 17:24

今天我们继续来聊这个系列第四篇的内容。前几篇我们把Agent的整体框架讲得差不多了,现在来深入一个非常关键的能力——

自主学习

。准确地说,不是学习知识,而是

学习技能

,或者说学习一种反应模式。

AI的学习通常分几种:一种是学公有知识,比如百科全书里的内容;一种是学用户相关的信息,也就是我们常说的

对话长期记忆

;还有一种,是学

技能

,学的是怎么想、怎么说、怎么做。这篇文章的核心,就是讨论Agent如何实现后面这种能力——

自主的技能学习能力

如何让agent自主学习技能?

深度agent解析
< 第四篇 >

Creating a new species of intelligence is the greatest mission of our generation

( 引言 )

反应模式二态性:4个类人技能学习能力的底层逻辑

先做一个基础铺垫。什么是反应模式?简单说,就是实现行为、思维、表达目标的策略,你可以把它理解成一种做事的套路或技能。情绪系统决定最上层的目标——比如“我想干这件事”;而反应模式系统,则决定了这个目标怎么被分解、怎么落地执行。

对人来说,反应模式是二态的:它既可以是

认知态

的,也就是我们头脑中思考的、抽象的策略概念;也可以是

执行态

的,也就是直接用来驱动行为的指令。这种二态性,正是四个类人技能学习能力的根源——请注意,这里说的学习,不是学知识,而是学行为、思维和表达的策略。

具体是哪四个?

第一,自然语言学习。

我们直接用自然语言告诉AI怎么干一件事。这时候,这条信息最初是认知态的——你理解了它的意思。但如果它同时也能转为执行态,AI就能通过你的口头或文字指令,学会完成一项新任务。这其实就是我们日常教人的方式。

第二,观察抽象,举一反三。

AI观察你是怎么完成一个目标的,最初生成的是很具体的、适应于当前场景的步骤信息。然后它可以从多个这样的样本中抽象出更高层的模式。等轮到自己执行时,再从抽象模式演绎出适配当前场景的具体方案。整个过程在认知态完成。如果最后生成的方案可以转为执行态,那么AI就能像人一样:观察、抽象、举一反三。

第三,从计划到执行。

生成计划,本质上是认知工作,计划信息也是认知态的。但如果这条计划信息能直接转为执行,AI就可以像人一样:先想好怎么做,然后照着做——想和做,是同一套东西。

第四,通过实践反思来优化反应模式。

AI把自己的反应和反应的效果,当作认知的客体,在认知层面对得失进行反思,然后优化。比如,AI用一种强硬的方式去说服一个强硬的人,失败了;这时它联想到“柔能克刚”,于是形成了一个新的策略:用温和的方式说服对方。整个过程在认知中完成,新生成的策略是认知态的。如果它同时又是执行态的,那AI就能通过“实践—反思—优化”来持续改进自己。

在MTSagent体系中,思维工程里的反应模式对应的是

策略记忆

。我们让GPT在每次根据目标生成执行方案时,先从策略记忆里联想相关策略,再生成具体执行策略。因为策略记忆是认知态的,而这个过程让它可以被转化为执行。所以,这个结构天然具备了“反应模式二态性”。

策略提示:技能学习能力的源头在Agent中如何落地

具体怎么落地?我们为每个封装好的GPT执行,都配了一个

策略提示

。第一步,每个执行的初始策略,由GPT基于自身的常理、背景信息和目标来生成。但我们把策略生成本身也视作一个执行,它的背景提示里包括联想的策略记忆。这样,最终生成的策略就受到了记忆中相关策略的约束——策略记忆因此具有了执行态。而策略记忆本身是用自然语言表达的,是认知态的。所以,策略记忆就有了反应模式的二态性。

那这四个类人学习能力,在Agent里分别对应策略记忆的哪四个来源?

第一个来源:自然语言教授。

我们只需要在感知流里建立一个“策略祈使”的分流,再做一个策略规整API,它能捕获感知流中识别到的策略祈使,规整后存储起来。这些策略会在表达生成、思维求解、以及其他任务API中被联想,从而影响Agent的表达、思维和行为。举个例子,你可以直接告诉Agent:“别人攻击你时要反击,攻击一个人可以想想他的自卑点。”——这些指令会直接影响它的反应模式。

第二个来源:学习他人的样本。

比如给Agent一份对话样本。我们封装一个GPT API,让它回答几个问题:这个对话者试图达到什么目的?他达到没有?如果达到了,总结一下他在什么情形下用了什么策略?第三个问题的答案就是策略信息,策略规整API会摄取它,规整后存入合法的策略。这个来源让Agent能通过观察样本进行模仿学习。比如学了销售对话,就能用样本里的策略去做销售;学了某人的安慰模式,就能模仿他的方式来安慰别人。

第三个来源:从计划到执行。

这种把目标分解为具体策略的方式,我们称为“目标求解”,它是问题求解的一个子类,会被“求解者”捕获。生成的答案写入感知流,是一类策略信息。我们把感知流中的这类信息分离出来,规整后存入策略记忆。这样,Agent就可以先想好了再做。策略的思考分两种:一种是针对具体目标的,比如“说服某个投资人”;求解者会先问一些背景(这个人有什么特点?公司怎么样?),然后生成具体策略。另一种是针对抽象目标的,比如“如何说服一个风险厌恶者”或“如何说服投资者”,生成的是抽象策略,作为背景知识影响后续的具体执行。

第四个来源:实践反思优化。

每次Agent切换对话目标时,我们建一个程序,把这个目标下的对话记录截取出来,再建一个GPT API问几个问题:我达到目的了吗?没达到,原因是什么?根据原因总结优化策略。生成的策略走规整API,形成新的策略记忆。这样,AI在说服某一类人总是失败后,就能通过认知修改优化策略,几次尝试后形成稳定的技巧。

策略的驱动机制:如何让策略真正驱动行为

策略大致分两类:一类描述

什么时候激活一个目标

,比如“别人攻击你,你要反击”;另一类描述

目标如何实现

,比如“攻击一个人,可以先想想他的自卑点”。激活的执行也大致分两类:一种叫宏观执行,它下面还有更细的策略;另一种叫基础执行,不再继续分解。

策略的驱动由三个GPT API组成。

第一个API,负责判断是否需要激活某个策略。它根据当前任务频道的工作记忆和活跃的策略语句,判断哪个策略的条件触发满足,然后把激活的策略转给第二个API。

第二个API,负责条件判断。它要识别策略中的条件是否符合。如果条件满足,就分离出执行表述交给第三个API。如果条件里有不能判断的部分,它会分离出必要条件的自然语言表述和执行表述,程序会挂起执行并记录必要条件。这些条件作为求解问题抛回感知流,被求解者捕获。如果未来完成求解,就会根据记录重新激活执行。

第三个API,负责激活执行。它要分辨执行的类型:如果是对话目标(比如“语言攻击对话者”),就发给对话目标管理模块,该模块在表达目标被选中时,检索该目标下的策略并写入对话生成提示;如果是思维求解目标,就把问题发到感知流,答案会改变工作记忆和长期记忆;如果是搭建类任务(比如写作任务中的“根据评论生成修改策略”),则会分离出变量搜索语句,在长期记忆中搜索相关信息,写入背景提示,并作为需求提示执行。

说到这里,不妨比较一下单一大模型里的策略提示和MTSagent的策略。在单体模型中,我们可以在提示里写一条“永久策略提示”。但如果策略太多,比如超过几百条,大模型就很难在合适时机选对策略了。而在MTSagent中,我们可以储备几千条策略,策略驱动只在需要用的时候激活对应的策略,写入表达或思维。这实现的是“动态策略提示”。

认知和策略的联动:知识如何服务于执行

策略是一种特殊的信息,可以转为执行。但它本身也是一种知识——描述了“什么情况下该做什么”以及“怎么实现特定目标”的知识。既然它是知识,就可以被求解。这种求解的特定子类,就是“目标求解”。

对于一个具体的目标,它可能是多个母类目标的子类。比如“说服某个自我中心的女人”,可能是“说服女人”和“说服一个自我中心的人”的子类。按照定义,母类目标的反应模式可以被子类继承。做目标求解时,就需要联想到母类目标的策略,作为工作记忆,让GPT生成具体的策略。

目标求解作为求解的子类,其动机强度决定了运算深度:动机越高,对工作记忆搜索的深度越大,分解的广度也越大。失败的求解会被重复唤醒,好奇者也会更多次地追问相关问题。按不严格的认知原理,求解的动机与资源消耗成正比,也与求解效果成正比。

如果个体已经提前思考过母类目标的策略,那在子类目标求解时,工作记忆就能联想到母类策略。相比之下,没有这种准备的情形,大概率不会更优。同样,如果具体任务被提前求解过,那正式执行时就不需要再临时思考,可以直接用已有的策略记忆。

在实操中,我们测试过认知如何贡献于更优的执行。比如,让AI说服一个具体的风险厌恶型投资者。理论上,有前置思考生成的策略,应该优于直接进入执行。而如果母类层也有思考准备——比如提前思考过“如何说服投资人”或“如何说服风险厌恶者”——那么在求解动机同等的情况下,有母类层思考的表现又会优于没有的情况。

策略的分类:对话、思维与搭建任务

对话策略

。分两类:一类描述何时激活对话目标,比如“对方攻击你,你要反击”;另一类描述目标如何反应,比如“攻击对方,可以攻击他的自卑点”。执行中可以包含思维执行,最常见的思维执行是检索执行。“攻击对方的自卑点”中的“他的自卑点”,就是一个检索执行。当攻击目标形成时,这个检索思维会被触发,并把检索结果写入表达执行的工作记忆。

思维策略

。最常见的执行还是检索执行。所有执行都有背景信息检索提示。思维执行中的联想策略,比如“思考如何说服一个人,可以想想这个人想要什么”——其中“这个人想要什么”就是一个联想策略。当求解目标是“如何说服一个人”时,工作记忆的检索就会去搜索“这个人想要什么”,把相关信息写入工作记忆。

搭建任务中的策略

。大致也分两类:一类描述什么情况做什么,另一类描述怎么做。以写作为例,前者比如“标题下字数超过2000就拆分子标题”;后者比如“介绍哺乳动物要重点介绍其繁殖过程”。

在Agent的设计中,我们有个总结:

所有GPT执行皆可被策略

。这是一条很有意思的原则,沿着这个方向能发掘很多深度玩法,让Agent的每一步运作都被干预、被自身反思、被自主优化。

-END-

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc