热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >告别“单科专家”:首个Agent全面进化框架EEVEE发布

告别“单科专家”:首个Agent全面进化框架EEVEE发布

来源:互联网 更新时间:2026-06-22 16:24

过去两年里,AI Agent的能力边界被不断刷新。会写代码,会调用工具,会反思自己的失败,也开始能在任务执行中一点点积累经验。

但一个更现实的问题也正在浮现。

当Agent真正被部署到了真实世界,它还能继续变强吗?不是在一个固定的benchmark上反复刷分,也不是只针对某一种任务来回改prompt——而是在真实使用中,同时面对代码、数学、知识问答、公式计算、复杂推理等不断变化的任务输入,它还能不能持续适应,稳定提升?

这正是EEVEE想要解决的问题。

来自上海交通大学与普林斯顿大学的研究团队,发布了EEVEE——一个面向LLM Agent的测试时提示学习框架。它的想法,是把prompt learning从“单一任务优化”推向更接近真实部署的场景:让智能体在多类型任务不断涌入时,仍然能够继续学习,而不是顾此失彼。

单一任务上的进步,还不够

今天已经有很多prompt optimization方法,可以让模型在一个任务上变得更好。

比如,在一个数学题集上学会更严谨的解题步骤;在一个代码任务上学会输出更规范的函数体;在一个问答任务上学会更符合评测格式的回答。

这当然有价值,但它离真实的Agent还差一步。

真实部署中的Agent不会只遇到一种任务。它可能上一秒在写代码,下一秒在做金融公式计算,再下一步又要回答科学问题。不同的任务,要求的行为完全不同:有的要求严格输出格式,有的要求符号推理,有的要求知识判断,有的要求可执行代码。

如果所有反馈都被塞进同一个prompt,问题就出现了:一个任务上学到的经验,可能会伤害另一个任务。

比如,为了公式题学到“只输出数字”,可能会影响需要解释推理过程的题;为了代码题学到“只输出函数体”,也可能不适合知识问答。任务越多,单一prompt就越容易变成一个互相冲突的杂糅体。

这就是EEVEE要面对的核心挑战:智能体不能只在单科变强,而要在多种任务中一起进化。

任务越多,差距越明显

EEVEE最有说服力的结果,不是单个任务上的分数,而是任务不断增加时的表现。

研究团队把多个不同类型的任务依次加入同一个学习过程,观察不同的prompt learning方法,能不能持续累积收益。

结果相当直接:

当任务越来越多时,一些强基线方法的收益开始停止叠加,甚至跌到负数;而EEVEE仍然保持正向提升,最终在所有任务都加入后,达到了约+42的累计提升。

换句话说,EEVEE的优势不是“单点提分”,而是任务变复杂之后,它还能继续往上走。

这一点非常关键。因为真实世界里的Agent,面对的永远不是一个干净、封闭、单一的任务环境,而是不断变化的任务组合。

告别“单科专家”:首个Agent全面进化框架EEVEE发布

全方位的提升:不同模型上都有效

在主实验中,研究团队使用了四类代表性任务:知识问答、公式计算、数学/符号推理、代码生成。这些任务组合在一起,构建了一个更接近真实Agent工作负载的混合环境。

在这个设置下,EEVEE在不同的backbone上都带来了明显提升:

  • 在Qwen3-4B-Instruct上,平均分从41.37提升到51.75,相对提升约25%
  • 在DeepSeek-V3.2上,平均分从39.75提升到64.07,相对提升约61%
  • 相比现有SOTA prompt-learning方法,最高相对提升达到48.2%

这说明EEVEE并不是只对某个特定模型、某个特定任务有效,而是在更广泛的混合任务设定中,都能让智能体获得更稳定的整体提升。

告别“单科专家”:首个Agent全面进化框架EEVEE发布

不只是“多开几个prompt”:EEVEE如何让智能体分工进化?

EEVEE的思路,可以用一句话概括:先分流,再用专门的prompt推理。

它不再让所有任务共享一个prompt,而是维护多个专业化的prompts。每当新的输入到来,EEVEE会先判断它更适合哪一类prompt,再让模型带着对应的prompt去回答。

但这并不是简单的人工分类。

EEVEE不会事先规定“数学题走数学prompt,代码题走代码prompt”。因为真实任务的差异,往往不在表面的任务名称上,而在于不同prompt的实际表现上。

同样是数学题,有的需要公式计算,有的需要定理推理,有的需要严格的输出格式。真正有用的划分,是在学习过程中逐渐形成的。

这也带来了一个关键难点:router和prompt不能分开学。

router决定了每个prompt会看到哪些样本;而prompt的能力,又决定了怎样的路由才是有意义的。所以,EEVEE采用了router–prompt co-evolution:先优化router,重新划分任务;再优化每个prompt;随后把更新后的prompt反馈给下一轮router。这个过程不断循环,让路由越来越清晰,prompt越来越专门化。

最终,智能体不是靠一个越来越长、越来越混乱的prompt去适应所有任务,而是把经验组织起来,让不同的任务模式进入更适合自己的学习路径。

单一任务上,依旧优秀

一个很自然的问题是:如果EEVEE是为多任务设计的,它会不会牺牲单任务的能力?

实验给出的答案是:并不会。

当每个benchmark单独进行prompt learning时,EEVEE仍然保持了很强的竞争力。例如:

  • Formula任务达到55.25
  • HumanEval任务达到73.17
  • TheoremQA从14.73提升到25.27

这说明EEVEE并不是靠着“路由”来掩盖prompt learning本身的不足。相反,它的prompt学习机制在单任务上同样有效;而当任务变多时,router才进一步发挥组织经验、避免互相干扰的作用。

告别“单科专家”:首个Agent全面进化框架EEVEE发布

不靠堆砌上下文

很多让Agent变强的方法,都有一个共同的副作用:上下文越来越长。

系统不断地把经验、规则、案例、playbook追加进prompt,短期内看可能有效,但任务一多,成本就会迅速上升,prompt也会变得冗长混乱。

EEVEE没有走这条路。

虽然它增加了一个路由步骤,但整体的token成本仍然保持在较低水平。实验显示,EEVEE平均每个测试样本使用4.32K tokens,接近高效的prompt-learning基线GEPA的3.47K,远低于ACE的21.30K。

也就是说,EEVEE的提升并不是靠无限扩展上下文堆出来的,而是来自更有效的任务组织和prompt specialization。

Prompt learning真正学到的是什么?

论文中的案例分析也揭示了一个非常有趣的现象:

Prompt learning最擅长学习的,不是凭空补充知识,而是把反馈转化成可复用的做事方式。

在代码任务中,它能学会保持函数接口、输出可执行代码、处理边界条件;在公式任务中,它能学会正确套用公式、保持单位尺度、输出符合评测要求的答案格式。

但对于知识密集型问答,情况会更复杂一些。Prompt learning可以让模型推理更系统,却不一定能补上缺失的领域知识。如果模型本身就缺少关键事实,单靠prompt往往解决不了。

这说明EEVEE并不是在宣称prompt learning可以解决一切。它真正展示的是:当反馈能够变成可复用的过程、格式和策略时,智能体可以在测试时持续吸收这些经验,并把它们组织到更合适的prompt中去。

这,比单纯“改一个prompt”更接近真实Agent的学习方式。

告别“单科专家”:首个Agent全面进化框架EEVEE发布

让Agent从单科进步走向全方位进化

过去的prompt optimization,更像是在训练一个Agent做好某一门课。

它可以在一个固定任务上反复练习,逐渐摸清规律,拿到更高的分数。

但真实世界要求的,不是“单科提分”,而是更接近“全科成长”:任务不断变化,反馈不断变化,能力需求也在不断变化。一个真正有用的self-improving Agent,必须能在部署后继续适应这些变化,而不是只在单一benchmark上越来越熟练。

EEVEE的意义就在这里。

它把test-time prompt learning从单一任务,推向了多类型任务共同到来的场景,让智能体开始学习如何组织经验、区分任务模式、保留不同能力,并在复杂的任务流中继续提升整体表现。

这当然还不是最终形态。论文也指出,EEVEE仍然依赖ground-truth或rule-based feedback,还不是完全在线、完全自监督的自我提升系统。

但它迈出了关键一步:当智能体真正面对真实世界中复杂、多样、不断变化的任务时,prompt learning仍然可以成为一种有效的持续适应机制。

从单一任务到全方位进化——这就是EEVEE想打开的一扇门。

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc