来源:互联网 更新时间:2026-07-16 11:45
代码Agent这两年为何进步飞快,成为AI界的宗门大师兄?
因为这玩意儿自己个儿就超!闭!环!的!
代码Agent可以自动执行、自动验证、自动反馈。写了代码跑一下就知道对不对,奖励信号非常清晰明确。这就为后训练阶段的自反馈闭环提供了完美的土壤。
同样是AI界的大热门,
它面对的物理世界比代码Agent面对的世界复杂得多,而且很难得到即刻验证。它接收的信号不像代码那样,一个编译器就能判定,它们模糊、昂贵,而且每一次真机试错都意味着真金白银的人力和硬件损耗。
大家有点着急。
这也不行那也不行,具身智能,你到底要怎样?
这时,原力灵机相关负责人站出来表态:
给技术路线贴标签,这事特别蠢。应该以目标为导向——你要解决什么问题,就挑选对应的方法去解决它,而不是说自己是某某方法、某某流派的,非得证明只有自己才是标新立异的那一个。
据他介绍,大约今年过年前,原力灵机就意识到可将世界模型作为后训练的一部分。一晃眼半年过去了。
“这套基模支持多模态输入,包括任务指令、图片和视频,还能选定机器人类型。我们可以凭借历史动作,预测后续视频状态。”
他介绍道,DW0.5用上万小时真机、多视角数据完成联合预训练,仿真能力很强,能生成各类画面。不光能做出机械臂正常作业的视频,就算参考错误动作,也能还原任务失败的场景,以此支撑DFOL2.0框架的在线强化学习训练。
DW0.5作为一个高保真仿真器,把强化学习搬进了虚拟世界。VLA先给出候选动作,DW0.5在虚拟环境中预演未来,判断成功、失败与偏离风险,再把可用反馈送回强化学习。按其披露的数据,这套流程可让后训练中真机数据需求骤降60%,整体训练成本下降40%。
想了解DW0.5,得先看清它解决了什么样的行业问题。
真机一次rollout需要占用机器人、场地和人工,一次动作失败可能直接让任务中断;人工反馈虽然更接近真实判断,但难以高频覆盖每个中间状态;仿真环境成本确实低很多,但现实中的接触、遮挡、反光、形变和不确定性又很难被完整复刻。
基于这个现实,原力灵机从技术侧提出了判断:
然后,新的办法就被“脑暴”出来了:用真实Rollout数据校准世界模型,世界模型支持低成本大规模的环境与数据生产,新的policy再回到真实环境验证和收集数据。
DW0.5能预测动作执行后的未来状态,甚至生成失败轨迹,并对任务进度打分。具体而言,它由Video Expert、Action Expert、Value Expert三大专家模块组成能力链路。Video Expert与Action Expert共同服务动作后果预演,Value Expert负责价值评估与反馈构造。这三个设计的思路各有讲究。
在部分世界模型里,动作信息只是一个附带的条件输入。但DW0.5把动作当成结构性的强先验——它必须知道“机械臂在往这个方向移动”,才能预测出物理上合理的后续画面。
DW0.5把action当作视频生成的一等条件,通过结构化的帧级对齐强制绑定。在MoT(Mixture of Tokens)注意力中,动作序列与视频序列拼接,并用group-diagonal attention mask切断视频帧与非对应动作之间的信息通路。从结构上,执行“向左推”和“向右推”的动作,从一开始就走向完全不同的计算路径。
讲道理,近期学术界对这个技术趋势有不少探讨,即主流VLA不做视频预测,只做observation到action的映射。DW0.5这类用视频预测作为辅助监督的模型,理论上能学到更强的因果动态理解。
只有成功轨迹数据训练的模型容易形成过强的成功偏置,这样的系统无法识别错误动作,更谈不上为强化学习提供惩罚信号。同时,失败轨迹数据的价值对后训练来说相当珍贵。
因此,DW0.5被明确要求能够生成“做砸了”的视觉轨迹,让Value Expert可以对比成功与失败的差异,给出有区分度的打分。其数据策略围绕模拟失败设计,让模型既学习“应该怎么做”,也学习“做错了,世界会变成什么样”。
团队表示,DW0.5
这是DW0.5从“视频世界模型”走向“训练环境”的关键一步。Video Expert模拟动作后果,Value Expert把后果转成可优化信号,两者结合,才构成完整的RL训练闭环。
具体讲,Value Expert对当前状态、候选轨迹或整段rollout给出成功概率或任务价值评估,将稀疏的任务结果信号转化为可以在每一步使用的中间反馈。在闭环系统中,它可用于:
数据显示,DW0.5的Value-Order Correlation达到95%以上。
三个设计服务于同一个闭环,让DW0.5在VLA的训练和部署中扮演离线数据增强与偏好构造、RL后训练环境、部署时规划与安全评估三种角色。依托DW0.5训练-调优-部署的全闭环赋能能力,模型在工程化泛化表现方面同样值得关注。
说了这么多架构和原理,最终还是要回到一个问题:DW0.5到底怎么用?
整体来看,DM0.5作为基础策略模型,DW0.5负责动作后果预演与价值反馈,RL将两者链接。基座模型DM0.5先生成一批初始动作,推给世界模型DW0.5——DW0.5当仿真器,在虚拟环境里把这些动作会导向的未来“跑”出来,批量生成成功和失败的轨迹——再由一个强化学习教练员CFG-RL,给每条轨迹的任务进度打分(成功的价值一路走高,失败的价值断崖下跌)——打分和奖励实时回传,更新模型权重,喂出一个更强的DM0.5。
这个循环里大部分数据由DW0.5在线生成,不用全部靠真机翻来覆去高成本地去试。
纸上谈兵终觉浅。可以看到,在打气球、晾衣服、叠纸盒等高难度复杂任务中,接入DFOL 2.0的模型相比单纯SFT(监督微调)基线,关键步骤成功率骤然提升。
评测集这边,DW0.5还在EWMBench、WorldArena等基准测试中横扫榜单,分别以4.73、73.54的分数,斩获全球SOTA(数据截至7月9日)。
真实部署进展方面,原力灵机表示DW0.5
值得强调的是,原力灵机再三
关于世界模型在具身智能领域的运用,还有其他想法吗?得到的答案是:
那么,就让时间来检验这个答案吧。
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
腾讯ima怎么创建共享知识库?
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
腾讯ima怎么把微信内容一键导入知识库?
区块链OTC交易所有哪几家比较正规?
2026热门直线加速赛车手游推荐:高人气、爽快加速体验的精品榜单
kimi提示词专家使用方法新手指南
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
原神霜月三处月灵龛具体位置汇总
《幻兽帕鲁》不触发通缉捕捉传说商人方法
Windy卫星云图怎么看?云层变化识别技巧
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
为什么推特KOL都在BRC20赚钱 我一冲就亏?
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
一加手机如何设置三指长按屏幕局部截图
合集38个项目筹集5.406亿美元 Figure融资2亿
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc