热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >智源大会 | 天工AI重新定义世界模型,公布Matrix-Game 3.5 最新技术突破

智源大会 | 天工AI重新定义世界模型,公布Matrix-Game 3.5 最新技术突破

来源:互联网 更新时间:2026-06-15 13:19

6月中旬的北京,第8届智源大会如期举行。这次盛会聚集了2位图灵奖得主、8位院士、30位30岁以下青年科学家、40余位AI企业CEO及创始人,他们围绕Agent、世界模型、具身智能、AI自进化与AI安全等前沿话题展开了深入讨论。 在众多议题中,世界模型无疑是最抢眼的焦点之一。来自具身智能、机器人控制、游戏引擎、物理AI基础设施等多个领域的研究者,各自亮出了技术路线图,围绕世界模型的深度议题展开了激烈碰撞。 昆仑万维旗下Skywork首席科学家刘扬,正是在这场分论坛上发表了主题演讲并参与了圆桌讨论。他的演讲主题是《Matrix-Game:长时序记忆下的实时流式交互式世界模型》,系统梳理了Matrix-Game的研发历程和最新进展。基于对世界模型本质的深度思考,他提出了一个全新框架——下一帧状态的生成与动作的生成,应该进行联合训练。此外,他还首次披露了Matrix-Game 3.5的核心技术突破。这款新版本计划于2026年7月正式发布,团队也将在近期发布一份包含更多技术细节的报告。

1. 定义世界模型:从“预测下一帧”到“状态-动作联合生成”

放眼全球,世界模型赛道正呈现出技术路线快速分化的格局。但一个共识也在逐渐清晰:世界模型已不再是一个纯粹的学术命题,而是已经演变为机器人、仿真、游戏和通用AI底层能力的竞争前线。在国内,昆仑万维的Matrix-Game,可以说是这条赛道上起步最早、系统化程度最高的力量之一。 智源大会 从技术落地的角度看,目前全球世界模型赛道的主流技术路线已经相当清晰:先是进行大规模的双向DiT预训练,然后通过Self-Forcing或Causal Forcing蒸馏为因果模型,再配合KVCache实现流式推理,最终达到25FPS的实时交互水平。与此同时,还需要辅以记忆注入机制来解决长时程一致性问题。这个路线图,基本成了业内通用的操作范式。 昆仑万维的Matrix-Game 2.0,正是这套技术范式下首个开源的实现方案。而后续的3.0版本,则首次系统性地把记忆问题纳入了开源解决方案。眼下,Skywork的Matrix团队正全力推进从3.0到3.5的升级迭代,核心目标只有一个:攻克世界模型长时序生成中的记忆瓶颈,同时实现5B参数模型在720P分辨率下的实时生成能力。 智源大会 基于长期的研究,刘扬指出,“世界模型”这个词在业内的定义混乱程度,远超普遍认知——视频生成、3D表征、交互式模拟器……不同方向的研究者所指的,根本就不是同一个东西。 智源大会 他在演讲中提出了自己的理解框架: **理解当下状态**:这一步远远超越了纯粹的视觉信息。一个真正的世界模型,需要理解物体级别的物理属性——比如墙是否可穿越、水的温度是多少。纯视觉信号天然无法覆盖这些信息。 **预测下一个状态**:在充分理解当前状态的基础上,模型需要对世界的后续演化做出推断。 **将预测结果渲染呈现**:让开发者和用户能够直观地看到“下一帧”。 不过,团队的思考并未止步于此。Matrix Game的实际训练过程揭示了一个更关键的结论:状态的预测与动作的生成,应该联合训练,而不是分而治之。当把下一帧状态的生成和动作的生成进行联合训练后,发现无论是对状态的理解,还是对状态和动作的预测,都带来了显著的提升。 这意味着,他眼中更完整的世界模型,是对状态与动作的联合理解与联合生成——而不是单向地观测世界、预测下一帧。根据具体应用场景,模型可以侧重输出状态(用于交互模拟器),也可以侧重输出动作(用于机器人控制)。这个统一框架,正是Skywork团队对世界模型认知的核心升级。

2. Matrix-Game 1.0-3.5:以游戏为切口,通向通用交互世界

从研发的一开始,团队就选择了游戏作为世界模型训练和交互验证的切入点。刘扬认为,游戏天然就是世界模型的完美载体:给定视觉输入和当前状态,接受玩家动作指令,然后输出下一帧。这个循环,跟世界模型的核心任务是完全同构的。更重要的是,游戏引擎可以在可控条件下生成高质量数据,并且精确记录视觉画面与对应的动作,这一点是自然界视频数据没法替代的。 自2024年下半年启动研发以来,Matrix Game在不到两年内完成了多次关键跨越: - **2025年3月**:Matrix-Game 1.0发布,成为最早公开的可交互世界模型之一。 - **2025年8月**:Matrix-Game 2.0发布。这是业界首个实现分钟级实时长序列交互的世界模型,单卡B100、720P@25FPS。从概念验证走向工业可部署,而且业界首个开源方案。值得注意的是,DiT(Diffusion Transformer)的作者、纽约大学助理教授谢赛宁团队,就基于Matrix-Game 2.0的开源底座,发布了全球首个多人视频世界模型Solaris。这充分说明了Matrix-Game 2.0在基础模型领域的技术影响力和开源生态价值。 - **2026年3月**:Matrix-Game 3.0发布。5B参数蒸馏模型实现了720P@40FPS的实时生成,补齐了世界模型公认的三大短板——记忆(记不住)、长时程(跑不久)、实时性(跑不动),一举跻身全球第一梯队。 - **Matrix-Game 3.5**:这是本次演讲中首次系统披露的核心技术突破。这个版本最大的变化,是从游戏场景向真实场景全面扩展,支持多风格动态切换与指令控制,并且引入了NPC交互能力。同时,长时记忆能力也进行了全新升级。 刘扬用一句话概括了对未来的判断:**“世界模型不应只是一个仿真器,而应是一个联合训练的统一模型——对状态与动作同时理解、同时生成,根据应用场景自由组合。”**

3. 突破世界模型的数据瓶颈:构建无限数据引擎

在演讲中,刘扬特别强调了数据的重要性:数据决定了世界模型能力的天花板……不,是下限。团队在实践中发现,传统的数据采集方式存在三大痛点:人工采集成本太高、实机采集太耗时耗力、效率极低,根本无法满足大模型规模化训练的需求。世界模型需要一种全新的数据生成方式——能够无限生成带物理因果关系的数据,实现全自动、高效率、低成本。 智源大会 为此,Skywork团队构建了三条自动化数据生产管线,输出 Video + Pose + Action + Language 的高质量世界模型训练数据。截至目前,数据引擎已产出: - **500万+ 高质量视频切片** - **1万+ 有效训练小时数** - **1200+ 覆盖游戏场景数** 这一无限数据引擎的具体实现包括三个层面: **第一,基于Unreal Engine 5的自主探索管线。** 团队在UE5中搭建了常见的游戏场景,部署RL Agent进行自由探索。在探索过程中,可以实现毫秒级同步采集,完整记录视觉画面、动作状态以及一系列相关语义信息。 **第二,跨游戏自动化控制与探索管线。** 这条管线覆盖了《GTA V》《荒野大镖客2》《赛博朋克2077》等主流3A游戏,实现了跨游戏的自动控制、自动探索、自动录制和自动标注。 **第三,开放平台视频自动挖掘管线。** 从开放平台自动获取游戏视频,通过VLM(视觉大模型)评分筛选出高质量片段,然后自动完成镜头切分、过滤与结构化标注。

4. Matrix-Game 实践中的关键挑战与技术突破

这次演讲中,刘扬花了大量篇幅阐述训练过程中遇到的独特难题。这些细节在论文里通常不会呈现,但恰恰是现场观众最关注的部分,也为业内做世界模型训练提供了实实在在的实战经验。 智源大会 **挑战一:动作信号与视觉画面之间的对应关系不明确** 大规模爬取游戏视频数据在理论上很有吸引力,但实际操作中发现:游戏画面向右上45度偏转,可能是由鼠标、键盘或者键鼠组合完成的——同一个视觉变化可能对应多种不同的动作。模型在学习时就会陷入严重的歧义。正如刘扬所说:“爬数据本身并不能解决动作标注的问题。我们需要大量主动构建数据场景,明确告诉模型:在这种情况下,物理规则是什么。” **挑战二:模型理解动作指令,却不理解动作带来的物理后果** 以《荒野大镖客》为例,模型很早就理解了“往前走”这个动作指令,但当真走到了墙前,模型完全不知道“墙不可穿越”,直接生成穿墙画面。这说明:理解动作的含义,与理解该动作在物理世界中产生的结果,是两项完全不同的任务。于是,团队建立了一套主动数据标注体系,大量手工构建边界场景,把这些“昂贵但不可跳过”的物理知识注入训练数据。 **挑战三:注入控制参数会破坏原始视频分布** 从1.0到3.0版本,团队一直把动作控制信号作为额外参数注入模型——鼠标信号通过Self-Attention注入,键盘信号通过Cross-Attention注入。这个直观的做法带来了持续的代价:每次加入参数都会破坏模型对原始视频分布的认知,需要花大量额外训练来“修复”基础能力。3.5版本做出了根本性的改变:不再引入额外参数,转而采用PRoPE(Projective Position Encoding)机制,通过相机投影矩阵让模型直接感知相机的相对位姿。这不仅降低了对原始视频分布的破坏,还极大地增强了泛化能力。 **挑战四:记忆检索方式决定了长时程一致性的上限** 早期版本的记忆机制很简单:原样存储历史帧,推理时检索相关帧然后拼接到上下文中。但这种方法问题很明显:占用大量上下文窗口,跨帧拼接时容易出现画面冲突,而且难以灵活更新。3.5版本进行了架构层面的升级:把历史帧切分为三维坐标系下的空间块(spatial tokens),检索时按空间位置匹配,再重新组合成当前视角的记忆图。这个设计带来了三重优势:画面一致性更高、相机轨迹保持更稳定,而且记忆可以随时更新、替换、删除,灵活性大幅提升。 展望未来,刘扬透露Skywork团队的下一个目标是构建一个原生统一的世界模型框架——让状态理解与动作生成从串联走向联合,从分裂走向统一。以此为支点,团队将推动世界模型跨越游戏的边界,迈向机器人控制与物理世界交互的更广阔疆域。他相信,世界模型终将成为通用人工智能的关键基石,重新定义智能体与物理世界的每一次交互。 在这条道路上,昆仑万维将持续深耕,步履不停。

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc