来源:互联网 更新时间:2026-06-15 13:19
从技术落地的角度看,目前全球世界模型赛道的主流技术路线已经相当清晰:先是进行大规模的双向DiT预训练,然后通过Self-Forcing或Causal Forcing蒸馏为因果模型,再配合KVCache实现流式推理,最终达到25FPS的实时交互水平。与此同时,还需要辅以记忆注入机制来解决长时程一致性问题。这个路线图,基本成了业内通用的操作范式。
昆仑万维的Matrix-Game 2.0,正是这套技术范式下首个开源的实现方案。而后续的3.0版本,则首次系统性地把记忆问题纳入了开源解决方案。眼下,Skywork的Matrix团队正全力推进从3.0到3.5的升级迭代,核心目标只有一个:攻克世界模型长时序生成中的记忆瓶颈,同时实现5B参数模型在720P分辨率下的实时生成能力。
基于长期的研究,刘扬指出,“世界模型”这个词在业内的定义混乱程度,远超普遍认知——视频生成、3D表征、交互式模拟器……不同方向的研究者所指的,根本就不是同一个东西。
他在演讲中提出了自己的理解框架:
**理解当下状态**:这一步远远超越了纯粹的视觉信息。一个真正的世界模型,需要理解物体级别的物理属性——比如墙是否可穿越、水的温度是多少。纯视觉信号天然无法覆盖这些信息。
**预测下一个状态**:在充分理解当前状态的基础上,模型需要对世界的后续演化做出推断。
**将预测结果渲染呈现**:让开发者和用户能够直观地看到“下一帧”。
不过,团队的思考并未止步于此。Matrix Game的实际训练过程揭示了一个更关键的结论:状态的预测与动作的生成,应该联合训练,而不是分而治之。当把下一帧状态的生成和动作的生成进行联合训练后,发现无论是对状态的理解,还是对状态和动作的预测,都带来了显著的提升。
这意味着,他眼中更完整的世界模型,是对状态与动作的联合理解与联合生成——而不是单向地观测世界、预测下一帧。根据具体应用场景,模型可以侧重输出状态(用于交互模拟器),也可以侧重输出动作(用于机器人控制)。这个统一框架,正是Skywork团队对世界模型认知的核心升级。
为此,Skywork团队构建了三条自动化数据生产管线,输出 Video + Pose + Action + Language 的高质量世界模型训练数据。截至目前,数据引擎已产出:
- **500万+ 高质量视频切片**
- **1万+ 有效训练小时数**
- **1200+ 覆盖游戏场景数**
这一无限数据引擎的具体实现包括三个层面:
**第一,基于Unreal Engine 5的自主探索管线。** 团队在UE5中搭建了常见的游戏场景,部署RL Agent进行自由探索。在探索过程中,可以实现毫秒级同步采集,完整记录视觉画面、动作状态以及一系列相关语义信息。
**第二,跨游戏自动化控制与探索管线。** 这条管线覆盖了《GTA V》《荒野大镖客2》《赛博朋克2077》等主流3A游戏,实现了跨游戏的自动控制、自动探索、自动录制和自动标注。
**第三,开放平台视频自动挖掘管线。** 从开放平台自动获取游戏视频,通过VLM(视觉大模型)评分筛选出高质量片段,然后自动完成镜头切分、过滤与结构化标注。
**挑战一:动作信号与视觉画面之间的对应关系不明确**
大规模爬取游戏视频数据在理论上很有吸引力,但实际操作中发现:游戏画面向右上45度偏转,可能是由鼠标、键盘或者键鼠组合完成的——同一个视觉变化可能对应多种不同的动作。模型在学习时就会陷入严重的歧义。正如刘扬所说:“爬数据本身并不能解决动作标注的问题。我们需要大量主动构建数据场景,明确告诉模型:在这种情况下,物理规则是什么。”
**挑战二:模型理解动作指令,却不理解动作带来的物理后果**
以《荒野大镖客》为例,模型很早就理解了“往前走”这个动作指令,但当真走到了墙前,模型完全不知道“墙不可穿越”,直接生成穿墙画面。这说明:理解动作的含义,与理解该动作在物理世界中产生的结果,是两项完全不同的任务。于是,团队建立了一套主动数据标注体系,大量手工构建边界场景,把这些“昂贵但不可跳过”的物理知识注入训练数据。
**挑战三:注入控制参数会破坏原始视频分布**
从1.0到3.0版本,团队一直把动作控制信号作为额外参数注入模型——鼠标信号通过Self-Attention注入,键盘信号通过Cross-Attention注入。这个直观的做法带来了持续的代价:每次加入参数都会破坏模型对原始视频分布的认知,需要花大量额外训练来“修复”基础能力。3.5版本做出了根本性的改变:不再引入额外参数,转而采用PRoPE(Projective Position Encoding)机制,通过相机投影矩阵让模型直接感知相机的相对位姿。这不仅降低了对原始视频分布的破坏,还极大地增强了泛化能力。
**挑战四:记忆检索方式决定了长时程一致性的上限**
早期版本的记忆机制很简单:原样存储历史帧,推理时检索相关帧然后拼接到上下文中。但这种方法问题很明显:占用大量上下文窗口,跨帧拼接时容易出现画面冲突,而且难以灵活更新。3.5版本进行了架构层面的升级:把历史帧切分为三维坐标系下的空间块(spatial tokens),检索时按空间位置匹配,再重新组合成当前视角的记忆图。这个设计带来了三重优势:画面一致性更高、相机轨迹保持更稳定,而且记忆可以随时更新、替换、删除,灵活性大幅提升。
展望未来,刘扬透露Skywork团队的下一个目标是构建一个原生统一的世界模型框架——让状态理解与动作生成从串联走向联合,从分裂走向统一。以此为支点,团队将推动世界模型跨越游戏的边界,迈向机器人控制与物理世界交互的更广阔疆域。他相信,世界模型终将成为通用人工智能的关键基石,重新定义智能体与物理世界的每一次交互。
在这条道路上,昆仑万维将持续深耕,步履不停。 腾讯ima怎么把微信内容一键导入知识库?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
腾讯ima怎么创建共享知识库?
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
WorkBuddy微信版怎么获得积分?
5000元起的鼠标哪个最值得入手?
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
车载冰箱重置到出厂设置几步?
短剧《史上最强洪荒修为》剧情介绍
kimi提示词专家使用方法新手指南
结婚家电首选:Leader懒人三筒Ultra热泵洗烘一体
腾讯ima知识库怎么分类管理?
比特币 2025 年价格预测:BTC 的未来走势
短剧《仙人跳获透视,古玩玉器我全拿捏》剧情介绍
Windy卫星云图怎么看?云层变化识别技巧
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc