热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >刚刚,LeCun团队让世界模型学会持续学习!

刚刚,LeCun团队让世界模型学会持续学习!

来源:互联网 更新时间:2026-07-06 15:24

世界模型,也能持续学习了!

刚出炉的成果,来自纽约大学和LeCun创办的

AMI

,是JEPA系列的最新进展——

AdaJEPA

和之前那些预训练完就冻结参数的世界模型不一样,AdaJEPA有个关键能力:它能跟环境不断互动,在这个过程中,通过

测试时自适应

,实时调整世界模型的编码器和预测器。这就实现了持续学习。

怎么操作?是这样的。AdaJEPA遵循一个闭环:计划、执行、观测、更新、再规划。每次交互时,它只会执行MPC规划出的第一段动作,等真实环境返回下一帧状态后,就把这个新观测当成自监督信号,拿去更新世界模型。这样一来,下一次规划时,模型就不是刚部署时那个冻结版本了,而是已经被当前环境“校准”过的版本。

听起来像经典强化学习里的

Dyna

思路——模型不是一次训练完就完事的,而是在真实交互中不断修正自己对世界的理解。实验结果也证实了这点。无论在分布内环境,还是面对各种分布外偏移,AdaJEPA的规划成功率都明显优于固定世界模型。

背后到底是什么原理?

计划、执行、观测、更新、再规划

一直以来,基于JEPA路线的隐空间世界模型,都有个默认前提:模型训练完,参数就冻结了。流程大致是这样:

  • 先在离线轨迹上学习,把高维图像压进latent space,然后在这个隐空间里预测未来。
  • 测试阶段,MPC(模型预测控制)调用这个冻结世界模型,在隐空间里往前“想象”未来,优化出一串动作,再把第一步动作拿到真实环境去执行。

(注:MPC的核心在于每次只向前预测一小段,算出一串动作,但只执行第一步。等真实环境反馈回来,再重新预测、规划。)

问题来了:

环境一变,冻结世界模型就容易失准。

当系统碰到测试时分布偏移,latent space里看起来很顺利的动作,落到真实环境里可能一步都走不对。更麻烦的是,MPC依赖短时域滚动规划,单步误差再往后滚几步,就会被放大。

为了解决这个问题,论文提出了AdaJEPA框架。核心判断很直接:世界模型不该训练完就固定在那儿。它应该像真正部署中的智能体一样,一边行动,一边用新经验校准自己。

具体来看,AdaJEPA的循环可以分成四步:

  • 规划

    :先用状态编码器把当前观测编码成latent state,然后借助当前世界模型进行MPC。在隐空间里向前滚动预测,找出一串最接近目标状态的动作。
  • 执行

    :不一次性执行完整动作序列,只执行第一段动作。真实环境返回下一帧观测。
  • 更新

    :把这次真实状态转移存进在线缓存区。然后让模型根据观测和动作预测下一步latent state,再跟真实状态预测编码出的latent state对齐。预测错在哪里,梯度就从哪里回来。
  • 再规划

    :更新后的世界模型立刻进入下一轮MPC。实验默认只更新视觉编码器和预测器的最后几层,每次重规划只做1步梯度下降。

因此,AdaJEPA的循环不再是传统MPC的“规划、执行、再规划”,而是变成了“规划、执行、观测、更新、再规划”。

世界模型也因此不再只是一个被动调用的“想象器”,而是变成了一个会在部署过程中持续校准自己的模块。

实现细节

实现上,AdaJEPA的底座依然是JEPA(联合嵌入预测架构)。和传统像素级预测世界模型不同,JEPA并不直接预测未来图像,而是先把图像压进更紧凑的隐空间,只在latent space里预测未来状态。整个模型由三个核心组件构成:

  • 状态编码器:把当前观测编码成隐状态。
  • 动作编码器:把动作编码成动作嵌入。
  • 预测器:根据当前隐状态和动作嵌入,预测下一步隐状态。

AdaJEPA的在线更新,就发生在隐空间里。每次执行动作后,系统会把真实状态转移存入在线缓存区。这个缓存区不会无限增大,默认只保留最近N条转移。更新时,AdaJEPA让模型根据当前观测和动作预测下一时刻的隐状态,再和真实下一帧观测编码出的隐状态对齐。

为了防止在线更新把原有表征空间拉崩,论文做了两个限制:一是对目标表征使用stop-gradient;二是只更新少量参数。实验默认只更新视觉编码器和预测器的最后几层,且每次MPC重规划只做1步梯度下降。

所以,这不是把整个世界模型在线重训一遍。它更像是每走一步,就用刚刚从真实环境里获得的新反馈,把世界模型往当前环境上轻轻校准一下。

实验测试

为了验证测试时自适应能否让冻结世界模型重新校准自己,论文在

PushT/PushObj

PointMaze

两个基准上做了实验。结果表明,在PushObj的未见形状上,AdaJEPA几乎把规划成功率翻倍。

而在PointMaze的未见布局中,提升同样明显:GD规划成功率从53.3%提升到78.7%,CEM从49.3%提升到70.7%。更关键的是,这种在线更新带来的额外延迟并不高,只有0.01到0.03秒。

这说明,AdaJEPA并不是用很重的在线训练来强行换更高成功率。它更像是在原有世界模型基础上,加入了一个轻量的“部署时自我校准”机制。总体来看,这篇论文阐述的核心理念是:

世界模型不必训练完就被冻结

,只要让它在部署时利用真实交互结果做轻量更新,就已经能显著提升应对环境变化时的鲁棒性。

作者介绍

最后,简单介绍一下论文的作者们。作者

Ying Wang

,纽约大学数据科学中心CILVR Lab的博士生,研究方向是世界模型,导师是

Mengye Ren

Yann LeCun

另一位作者

Oumayma Bounou

,纽约大学博士后研究员,研究兴趣集中世界模型、控制和优化,目前正与LeCun合作研究世界模型。

此外,纽约大学计算机科学与数据科学助理教授

Mengye Ren

和图灵奖获得者

Yann LeCun

共同担任指导作者。

参考链接[1] https://arxiv.org/pdf/2606.32026

热门手游

相关攻略

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc