来源:互联网 更新时间:2026-07-25 14:47
这几年,机器人领域和边缘AI一直在找一种能真正“落地”的模型——既要够小,能在边缘设备上跑,又要足够聪明,能完成实时控制。NVIDIA这次拿出的Cosmos 3 Edge,正是瞄准了这个缺口。它是一个4B参数的开源世界模型,专为机器人和边缘AI的实时推理场景设计。
不妨先聊聊它到底是什么。它基于Nemotron架构,但有意思的是,它融合了自回归与扩散两种Transformer,共享一个多模态注意力层。这意味着,它能在Jetson Thor、RTX GPU乃至DGX等设备上本地运行,实现15 Hz的实时控制。更关键的是,开发者大约只需一天时间,就能把模型适配到特定的机器人或环境——整个过程不依赖云端,设备自己就能完成感知、推理并生成动作策略。
留意一下它的核心能力,你会发现它在“理解-预测-行动”这条链路上做了不少功课。
技术层面,它有几个值得关注的设计亮点。
如果你打算试试看,流程其实很清晰。
nvidia/Cosmos3-Edge权重,同时获取后训练脚本与DROID数据集策略检查点。总结下来,它的优势有几个维度。
| 维度 | Cosmos 3 Edge | SmolVLA |
|---|---|---|
发布方 |
NVIDIA | HuggingFace / 社区 |
参数规模 |
4B | 450M |
架构类型 |
世界动作模型(WAM)双塔架构 | 视觉-语言-动作(VLA)模型 |
核心机制 |
自回归塔+扩散塔共享注意力,统一世界理解与动作生成 | SigLIP+DinoV2 双视觉编码器,分块动作预测 |
开源程度 |
完全开源(权重+训练脚本+后训练方案) | 完全开源(权重+代码+评估脚本) |
边缘部署 |
Jetson Thor / RTX PRO / T2000 / T3000,15 Hz 实时控制 | 单张RTX 4090,15–30 Hz 推理 |
微调成本 |
小型H100集群或DGX Station,约一天 | 单张A100或消费级GPU,数小时 |
动作输出 |
每次推理生成32个动作,通用几何向量表征 | 每次预测50步动作块,减少50倍计算调用 |
世界建模 |
内置世界模型,可预测动作的视觉结果 | 无内置世界模型,直接从观测映射到动作 |
适用场景 |
需因果推理与模拟的复杂操作、动态环境 | 结构化环境下的快速反应式抓取与放置 |
最后,看看它可能在哪里发挥作用。
黄金和比特币走势是相反吗?黄金和比特币哪个价值高?
55部泰腐剧全盘点,从《千星传说》到《以你的心诠释我的爱》
LITH币可以长期持有吗?LITH币价格最新行情
盘搜搜搜索入口地址 盘搜搜网盘资源在线查找入口
动漫《温泉物语OAD》剧情介绍
石头P30 Pro发布:8.98cm超薄热活水扫拖机器人
vivo手机怎么设置来电闪光灯 vivo手机来电提醒设置教程
iPhone 18支持多少瓦快充 苹果18选购适配器充电器推荐
闺蜜网名高冷女生(精选100个)
三款26年75寸Mini LED 电视横评|创维 A7H
短剧《云端负烟火》剧情介绍
2026磁轴键盘超短触发选购指南
超级简历wondercv的会员功能有哪些区别
小米手机怎么设置屏幕刷新率固定在120Hz
网名孤独清冷英文女生(精选100个)
短剧《成了太子妃,帝王竟是旧相识》剧情介绍
女生霸气网名快手(精选100个)
网名双字可爱沙雕女生(精选100个)
光环游戏助手核心功能实测:15倍速刷本与自动连点技巧【汇总】
电视剧《差一分的美味》剧情介绍
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc