热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >Al Agent:大模型时代重要落地方向

Al Agent:大模型时代重要落地方向

来源:互联网 更新时间:2026-08-01 14:29

大语言模型越来越成熟了,随之而来的就是各种基于大语言模型的AI Agent开始频繁进入我们的视野。Agent是什么?它和大模型本身有什么区别?未来又能往哪些方向落地?这篇文章会系统地梳理一下相关的知识点,聊聊大模型时代AI Agent的几个重要方向。

Al Agent:大模型时代重要落地方向

整个分享主要围绕五个方面展开:Agent的整体架构、重点难点问题、用户行为模拟智能体、多智能体软件开发,以及未来的发展方向。

LLM-based Agent 整体架构

一个典型的大语言模型 Agent,由四个核心模块构成。

1. 画像模块


这个模块主要负责描述Agent的背景信息。画像内容主要基于三类信息:人口统计信息(比如年龄、性别)、个性信息,以及社交信息。生成画像的策略也有三种:如果Agent数量不多,可以直接手工设计,然后把用户画像写进大模型的prompt里;如果需要大量的Agent,可以先指定少量画像作为示例,再让大语言模型批量生成更多;还有一种方法是数据对齐,需要根据已有数据集中的人物背景信息来构建prompt,然后做相应的预测。

2. 记忆模块


记忆模块的目的是记录Agent的行为,为它未来的决策提供支撑。记忆结构上,有的只考虑短期记忆,有的则把长期记忆和短期记忆结合起来。记忆的形式一般有四种:语言、数据库、向量表示和列表。记忆的内容操作上,常见的是读取、写入和反思三种动作。

3. 规划模块


规划模块可以分为两大类。一类是不需要反馈的规划,大语言模型在推理过程中不需要外界的反馈就能完成。这里面又分三种:基于单路推理(只调用一次大模型就输出完整步骤)、基于多路推理(让模型生成多个路径,从中选出最佳方案),以及借用外部规划器。另一类则是需要反馈的规划,模型要根据环境、人类或者其他模型的反馈来调整后续的动作。

4. 动作模块


动作模块涉及四个维度:动作目标(完成某个任务、进行交流、还是探索)、动作生成(依靠记忆回想还是按计划执行)、动作空间(是工具集合,还是基于大模型自身知识),以及动作影响(对环境的影响、对自身状态的影响、对未来动作的影响)。

这个整体框架更详细的梳理,可以参考这篇论文:Lei Wang, Chen Ma, et al., A Survey on Large Language Model based Autonomous Agents, CoRR abs/2308.11432 (2023)。

LLM-based Agent 重点&难点问题

当前大语言模型Agent面临的挑战,主要集中在以下几个方面。

1. 如何提升角色扮演能力


Agent的核心任务就是扮演某种角色来完成特定任务或模拟,所以它的角色扮演能力至关重要。这个能力要从两个维度来理解:角色与Agent行为的关系,以及角色在环境中的演化机制。定义了能力之后,就需要评估,包括评估指标和评估场景。最后是提升方法,常用的有两种:一种是通过设计更精巧的prompt来激发模型的能力,另一种是通过外部数据进行微调。

2. 如何设计记忆机制


Agent和大语言模型最大的区别,就是它能在环境中不断自我演化和学习,而这恰恰是记忆机制在起作用。记忆机制的设计通常有两种:基于向量检索的记忆和基于大模型总结的记忆。评估记忆能力需要明确指标和场景,最后还要分析记忆机制的演化与自主更新。

3. 如何提升推理/规划能力


这个领域又细分为两个方向。一是任务分解能力,包括如何定义和拆分子任务,以及如何确定最优执行顺序。二是推理与外界反馈的融合,既要设计出让Agent和环境互相交互的机制,又要提升Agent对外界反馈的响应能力——它不仅要能真实地应对外界,还要能主动提出问题、寻求答案。

4. 如何设计多Agent高效协同机制


多Agent的合作机制主要体现在两个层面。合作机制上,需要定义不同Agent的角色,并设计它们之间的协作方式;辩论机制上,则要设计Agent间的辩论互动,以及确定辩论何时收敛的判定条件。

基于大语言模型的用户行为模拟智能体

下面看几个实际的案例。第一个是基于大语言模型的用户行为模拟智能体,这也是早期将大语言模型智能体与用户行为分析结合的尝试。在这个工作中,每个Agent被划分为三个模块。

1. 画像模块


给不同的Agent指定不同的属性,比如ID、姓名、职业、年龄、兴趣和特征。

2. 记忆模块


记忆模块包含三个子模块:感受记忆、短期记忆和长期记忆。短期记忆会把原始观测数据加工成信息量更高的内容,然后暂时存放;长期记忆则是短期记忆内容经过反复触发和激活后自动转入的,存储时间更长,而且会根据现有记忆进行自主反思和升华提炼。

3. 动作模块


每个Agent可以执行三种动作:在推荐系统中的行为(比如看电影、查找下一页或离开系统)、Agent之间的对话行为,以及在社交媒体上发帖的行为。有趣的是,在整个模拟过程中,每个Agent在每一轮都可以自由选择这三种动作,不受外界干预。通过多轮模拟,不仅能观察到不同Agent之间的对话,还能看到它们在社交网络或推荐系统中自主产生的各种行为,甚至可以从中发现一些有趣的社会现象和用户网络行为规律。

更详细的描述可以看这篇论文:Lei Wang, Jingsen Zhang, et al., When Large Language Model based Agent Meets User Beha vior Analysis: A Novel User Simulation Paradigm。

基于大语言模型的多智能体软件开发

另一个典型案例是用多Agent做软件开发,这也是早期多Agent协作的代表性工作。整个系统的设计思路非常有意思——它把整个团队看作一家软件公司,不同的Agent扮演不同的角色。有的Agent负责设计,包括CEO、CTO、CPO等;有的负责编码;有的负责测试;还有的负责撰写文档。不同Agent各司其职,通过交流和协同机制,最终完整地完成一个软件的开发过程。

LLM-based Agent 未来方向

大语言模型Agent的未来发展,目前可以归纳为两大方向。

第一个方向是

解决特定任务

,比如MetaGPT、ChatDev、Ghost、DESP这些系统。这类Agent的目标是成为一个和人类价值观对齐的“超人”——既要对齐正确的价值观,又要具备超越常人的能力。

第二个方向是

模拟现实世界

,比如GenerativeAgent、Social Simulation、RecAgent等。这类Agent所需的能力和第一类正好相反:它们允许呈现多样的价值观,更希望尽量符合普通人的行为模式,而不是超越常人。

另外,当前大语言模型Agent还存在两个核心痛点。

第一个是幻觉问题。

由于Agent需要与环境不断交互,每一步的幻觉都会累加,产生累积效应,让问题变得更严重。解决思路包括设计高效的人机协作框架,以及有效的人类干预机制。

第二个是效率问题。

在模拟过程中,效率至关重要。不同Agent在不同API调用条件下的耗时差异很大,这对于实际落地而言是一个不可忽视的瓶颈。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc