来源:互联网 更新时间:2026-08-10 17:33
Agent,作为基于基础模型与人类多轮交互形成的端到端问题解决智能体,目前仍缺乏一种与环境的准确、灵活且能够自动优化的交互机制。美国伊利诺伊大学厄巴纳-香槟分校(UIUC)博士王星尧提出的CodeAct,正是为了填补这一空白——通过代码让Agent与环境交互,效率显著提升。CodeAct的核心价值在于,它能在与环境交互的过程中持续学习,不断寻找新数据并优化自身,这在互联网数据即将枯竭、模型能力遭遇瓶颈的当下,意义尤为突出。

CodeAct 整体框架图
传统Agent架构通过生成预定义的JSON或文本完成操作,操作空间和灵活性严重受限。CodeAct利用代码将Agent的行动整合到统一的行动空间中,并与Python解释器集成,能够执行代码行动,通过多轮交互动态修改先前的行动,大幅提升了Agent与环境的交互能力。
CodeAct的核心思想是用代码进行智能体-环境的交互(例如工具调用),从而提升效率和通用性。它的行动空间自然支持搜索、记忆等过程——比如记忆功能可以通过创建一个数据库来实现。
Agent与环境交互的环节都可以用CodeAct替代。
各类模型在 CodeAct 架构下处理不同复杂任务的性能
在复杂任务下,CodeAct的效果更为显著。以GPT-4-1106-preview为例,在M3ToolEval复杂任务中,CodeAct的性能比传统方案高出20%,同时交互轮数减少了30%。而且,CodeAct的优势会随着模型能力的提升愈发明显。
Agent中模型、人类、环境的交互需要协同。我们发表在ICML/ICLR上的CodeAct,主要专注于探索如何让模型更好地与环境交互——以代码为媒介,与人类使用者通过自然语言交互,这是CodeAct的核心思路。接下来,我们会顺着这个框架拓展更实际的应用场景。
CodeAct的架构可以自然兼容搜索、记忆等过程。记忆功能本身也可以通过CodeAct实现:一个原始的方法就是直接给模型创建一个数据库,模型会利用代码访问数据库API将信息一行行写进去;搜索也类似,直接给模型配备Google Search API即可。CodeAct提供了一种思想:用代码进行部署和工具调用,可以直接利用已有的代码软件包,节省大量人类开发者预先定义不同工具的额外工作。
在过去的Agent开发中,规定模型输出是非常痛苦的——模型永远会生成千奇百怪的结果,多一个空格或少一个逗号,都会导致Agent周围的工程化代码变得冗杂。然而,工具最终还是要用代码执行,执行完再喂回模型。模型根本不知道自己在与特定格式交互时,本质上还是在和代码交互。等于在Agent外面缠绕“十几层胶带”,让开发过程繁杂缓慢。CodeAct的思路就是少缠几层是几层,直接把整个环境暴露给模型,告诉它直接用Python指令交互。出现错误时,Python解释器返回的自动错误信息就能提醒模型进行代码修复。
总体来说,CodeAct相比过去的路径有四大优势:
目前,CodeAct已经能完成一些有意义的数据科学和数据可视化任务。未来,我们期待看到它解决更多端到端的问题,形成更复杂的应用。
我对OpenDevin的贡献,本质上是把CodeAct应用到现实生活中。CodeAct过去主要在Python上进行Agent-环境交互实验,但很多软件工程任务对Agent环境交互要求很高,最主要的环境其实是Bash Terminal(Linux系统的运行命令)。所以在OpenDevin中,我把CodeAct延展到了Bash语言上。近期我们还在尝试将OpenDevin延展到类似浏览器的编程语言上,用户可以通过语言控制浏览器。OpenDevin会逐渐支持越来越多不受限的语言操作。
CodeActInstruct 数据集对比其他代码数据集
另外,我们也在把CodeAct中的交互模式做成“基础设施”,通用到更多领域。目前CodeAct只与Python交互,主要是因为工程建造时长太高。但社区里大家普遍希望建造通用的软件工程Agent,因此会贡献不同的交互方式——比如CodeAct与Bash、浏览器等。我会利用好这些社区经验做好研究,然后反哺开源社区,打造更加通用化的Agent环境交互方式。
本质上,CodeAct是在提供Agent与环境交互的过程,强化代码作为媒介的方式,而不是加强底层模型的代码生成能力。Agent接入CodeAct后,还需要学习规划、决策、反思等具体能力。我们不希望Agent学会代码交互后就把其他能力摒弃了。人类能够从历史经验中不断学习哪些方案可行或不可行,下一步就是希望基础模型+Agent也能做到这一点。在未来互联网数据日益穷尽的背景下,这一点尤为重要。
关于合成数据,人类与环境交互的过程本身就在产生合成数据——那是模型自己合成自己的输出数据。短期内,通过合成数据提升模型表现是可行的。例如,Apple最近有一篇论文《Rephrasing the Web: A Recipe for Compute and Data-Efficient Language Modeling》,他们将预训练数据转写了一遍混进去二次训练,发现效果提升了很多。这相当于把模型数据中乱糟糟的内容“洗干净”,让模型学得更好。另外,CodeAct提出的利用代码加强Agent-环境交互数据迭代积累、强化在线学习能力,也是一种不错的提升方式。
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
腾讯ima怎么创建共享知识库?
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
区块链OTC交易所有哪几家比较正规?
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
2026热门直线加速赛车手游推荐:高人气、爽快加速体验的精品榜单
合集38个项目筹集5.406亿美元 Figure融资2亿
原神霜月三处月灵龛具体位置汇总
五菱星光L六座新能源SUV上市:三版可选,中配12.28
kimi提示词专家使用方法新手指南
如何修复Edge浏览器无法通过微软账号进行身份验证?
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
光遇致梵高季6个季节任务怎么做
为什么推特KOL都在BRC20赚钱 我一冲就亏?
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
华为Mate 70系列首发的红枫镜头下放至千元档:全员普及原色影像
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc