热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >Agent如何放大单体大模型能力?

Agent如何放大单体大模型能力?

来源:互联网 更新时间:2026-08-12 17:23

深度agent解析

Agent如何放大单体大模型能力?

< 第六篇 >

Creating a new species of intelligence is the greatest mission of our generation

( 引言)

这篇文章是“深度agent解析”系列的

第六篇

。今天,我们来聊一个核心问题:

agent和单体大模型之间到底是什么关系?

整个2023年,人类用一整年的时间确认了一个事实:单体大模型的能力是有限的。绝大部分大模型的应用,都停留在工具层面——人依然是理解工作本质的那个角色,只是在大模型这个工具上完成特定任务,然后根据它的输出,再决定下一步该问什么。那么,agent的出现,到底让局面发生了怎样的改变?先借用几位行业大牛的判断来说。

比尔盖茨的原话是:

“agent是新人工智能时代的正曲,真正的应用层兴盛以agent兴起为标志”。

吴恩达的观点更直接:

“GPT4+agent大于GPT5”。

说白了,agent就是GPT能力的放大器。

还有一种更形象的比喻:把

单体大模型

比作飞机的

引擎

,能量巨大;而

agent

则是飞机的

外壳和控制系统

——它负责组织、控制引擎的能量,让它真正飞起来。

接下来,我们具体拆解一下,agent到底是如何放大单体大模型能力的。

01 大模型的缺陷与Agent的出现

大模型为了完美拟合海量的表象数据,竟然在底层形成了对自然语言、逻辑运算的真实理解,拟合出了类人的思维和心智机制。因为这些底层智力的形成,大模型涌现出了各类能力。这是一个“从表层到底层,再泛化到表层”的过程。简言之,大模型为了拟合海量表层信息生成了类人的底层能力,这使得它能泛化出更多上层功能。跨任务能力就是典型——很多任务能力在训练样本中并没有直接体现,但大模型天然具备。

GPT是历史上第一个承载人类文明几乎所有信息的个体,并且具备了人类底层的逻辑智能和语言智能。从智力角度看,这就是一场核聚变。但问题是,距离ChatGPT的出现已经过去一年多,我们并没有看到这个核聚变级别的能量释放出来。为什么?因为虽然GPT内部已经蕴含了巨大的智力能量,但它自己不知道怎么组织和运用。我们需要教会AI如何组织和使用GPT的能力来完成复杂任务,而不是让人类去手动操控它。

大模型的根本缺陷,在于其

“刺激-反应”型的输出模式

。它需要人类给它出题、给它任务。但人类绝大部分综合脑力劳动,是过程性的,是反应链,而不是简单的一次性问答。

所以一个自然的思路就是:在模型外部把这个智能活动的过程复现出来。在关键的执行环节,给大模型“出题”,调用它的能力。如果目标是复现人类某一类特定的智能活动,这就是

任务导向的agent

——目前大部分workflow式的agent都属于这个范畴。另一个更深刻的思路是:反思并复现人类智能活动的一般过程,这就是

通用agent

。通用agent,是钱学森为代表的东方“道法自然”解构主义人工智能,与西方GPT的一次伟大结合。

02 突破单体大模型限制——互动类目标

先看互动类目标中的对话场景。传统上用纯GPT做对话,基本流程是:在对话者表达完后,把上下若干轮对话写入提示,让大模型生成下一句表达。为了创造多样的对话风格,会使用角色扮演类的永久提示,有时也会用微调的方式直接把风格训练进去。好一点的中间层会创建一系列提示变量——包括AI的心情、对对话者的态度、要表达的立场——然后通过一个系统监听自己的对话,维护这些变量,在每次生成表达时把变量嵌入提示模板。相比于简单的角色扮演提示,这种方式能让AI体现出作为一个个体在其存续时间内的状态变化。

而MTSagent为对话能力带来的第一个改变是:

自由思绪

。它打破了一问一答的对话模式。AI即使不说话,也有思绪在流动。用户的表达写入感知流后,会引发自由思绪,高关注度的信息形成短期记忆(对话工作记忆的一部分)。对话者陈述的信息、引发的AI认知信息、联想到的AI自身立场等等,作为工作记忆影响了表达的生成。在实验中,甚至可以控制AI只做倾听而不表达,然后在长时间倾听后再进行对话。

第二个改变是:

长期记忆能力

。不仅仅是对话者表达的高关注信息,还包括推知、问题求解获得的高关注结论,都可能从感知流沉淀到长期记忆,在未来对话中被联想,形成工作记忆,体现出长期记忆对对话的影响。这个能力在陪伴型对话中极其关键——agent会慢慢熟悉用户,利用对用户的了解创造日常互动。可以说,长期记忆的缺失,是纯GPT陪伴类AI在产品化上从未达到及格线的最重要原因之一。同样,在AI替代专家进行“深度进入用户情境的咨询”时——心理咨询、司法咨询、企业咨询、健康咨询——这些都需要持续跟进,需要agent记住之前咨询对话中的重要信息和关键结论。

03 突破单体大模型限制——搭建类目标

以写书为例,考察GPT在大型搭建类任务中的限制,以及MTSagent如何突破这种限制。

GPT可以写文章。因为我们可以一次性把文章的要求和素材装入提示,好比把所有搭建用的材料给到GPT,让它按要求搭建一个屋子。但如果是一本书呢?它的素材规模远远超过了提示的容量。更重要的是,即使是GPT4,70k的提示容量也只是一个理论值——当真正把这么大规模的素材写进提示,任务内的注意力会出现严重问题:

信息没有办法被使用到合适的地方。

在MTSagent中,面对大型搭建类目标,我们让大模型在脑海中扮演不同角色的工人。比如在写书这个任务中:有“规划者”负责输出和修改目录;有“工人”负责根据标题,从长期记忆中搜集素材生成标题下的内容;也有“工人”根据话题搜索闪光思想,生成内容,再根据内容生成标题;于是还有“工人”根据新增的标题修改已有的目录。通过这种方式,每个工人只需要在长期记忆的“任务画布”上每次完成一个单元任务,就能慢慢地把要搭建的大厦搭建修缮出来。

这里的关键是:如何定义单元任务、如何定义单元任务的工作记忆搜集、如何决定单元任务的触发——也就是单元任务之间相互配合的逻辑。换个角度说:在搭建类任务中,我们如何定义每类“工人”的工作,以及它们之间的配合逻辑?更进一步,agent能否自己为一种新任务定义思维中的“工人”,并组织它们的工作?

04 智能物种与通用agent

人工智能是一个宽泛的概念。但智能物种不同于现有的人工智能,它不是一个单纯的工具。

一个智能物种,需要和人类一样,具备独立让文明演进的能力。

人类文明有三个维度的度量。

其一是知识

——对客观世界的认知,包括表层规律和事物演化背后的机理;

其二

,基于这些知识,就

形成了干预因果链条、实现事件目标的方法

其三是工具

——工具是为了在特定环境下稳定而高效地控制因果链条而被创造出来的,已有的工具又为新的工具的创造提供基础。好比冲压机床为各种机器的搭建提供了基础,电脑又为其他工具的设计提供了基础。所以总结来看,文明活动由三个环节组成:认知过程、解决问题实现目标的过程、创造工具的过程。

通用agent反思了人类情绪决策、认知、记忆、执行相互配合的逻辑,让agent成为一个连续存在的个体——一个类人的个体。

具体来看通用agent构建了什么:

情绪决策系统中动机形成的过程、目标分解的过程,形成了人类目标和动机的脉络。为了实现目标,生成了“目标求解”并交给认知系统。认知目标在认知系统中不断分解,从“目标求解”的认知目标走向客观世界规律的认知目标。这些认知目标在不严格认知过程中不断被腐蚀、被求解。为了在特定环境条件下实现高效的因果链条干预、达成目标,人类形成了“工具创造求解”的能力用于创造新的工具 — 新的工具建立在已有工具之上,或是利用了已有工具的工具,随时间推移工具不断演进 —— 这三个维度(对客观世界的认知+控制因果链条实现目标的方法+工具的演进

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc