来源:互联网 更新时间:2026-07-31 21:13
在LLM圈里静悄悄,在机器人圈里直接搞了个大新闻。谷歌DeepMind刚刚放出了新一代机器人大脑——Gemini Robotics 2。
从最新放出的Demo来看,这一代模型不仅能听懂人类指令,还能控制机器人调动整个身体,完成移动、抓取和灵巧操作等一系列任务。和以往各家具身demo集中展示的桌面操作不同,这一次,Gemini Robotics 2明显把战场从桌面扩大到了机器人的全身。机器人不再只是站在原地伸手拿东西,而是要自己走到目标面前、调整身体姿态,再用双手乃至多指灵巧手完成精细操作。
与此同时,除了负责运动控制的Gemini Robotics 2,谷歌这次还一口气推出了另外两款模型,分别负责高级推理和端侧部署,直接凑齐三件套:
基于这套小连招,Gemini Robotics 2在全身操作、多指灵巧操作以及夹爪操作等任务上,都取得了相当不错的成绩。



在最新发布视频中,谭捷老师也全程亮相,并负责介绍这次工作。他是Google DeepMind机器人团队的首席研究科学家、技术负责人,本科毕业于上海交通大学。

接下来,我们具体来看。
先从负责运动控制的Gemini Robotics 2说起。如前所说,Gemini Robotics 2本质上仍然是一款VLA模型。它接收人类的语言指令和机器人摄像头捕捉到的视觉信息,再直接输出机器人的动作。
不过,这一代模型最大的变化,是开始把机器人的整个身体纳入统一控制,而不是上下半身的操作-移动解耦。
比如,当人类下达“把洒水器放进底层架子的绿色收纳箱里”这一指令后,Apollo需要先理解洒水器和绿色收纳箱分别在哪里,然后走向桌子、拿起洒水器,再移动到货架旁,弯下身体,将其准确放进指定位置。这看上去只是一次简单的收纳任务,但背后涉及的其实是一整套连续的全身移动与操作:机器人既要控制双腿行走和转向,也要调整躯干与手臂姿态,最后还要完成稳定抓取和精确放置。
换句话说,这一次的Gemini Robotics 2,不只是让机器人拥有了一双更灵巧的手,而是开始尝试把腿、腰、手臂和手指连成一个整体。
除了全身移动操作,最新展示的几个灵巧操作Demo也都相当惊艳。比如,机器人可以拿起灯泡,将它旋出灯座,同时控制手指的力度,避免把灯泡捏碎。它还可以双手协同,一只手拿着簸箕,另一只手拿着刷子,把桌面上的垃圾扫进去。也可以将葡萄装进密封袋,再捏住袋口两端,把塑封条完整拉上。还有一个操作更离谱:机器人会用一种人类看上去都相当别扭的指法,把塑料袋一点点撑开并套上去。
从Demo画面来看,这套系统似乎同时使用了头部的第一视角摄像头和腕部相机,让机器人既能观察整体环境,也能在接触物体时获得更近距离的视觉反馈。
当然,正如谷歌这次反复强调的,Gemini Robotics 2并不是只为某一台机器人定制的“大脑”。同一套模型可以迁移到不同机器人本体和末端执行器上,继续完成相似的操作任务。这也意味着,谷歌希望解决的不只是“让一台机器人学会一个动作”,而是让同一种能力能够在不同身体之间迁移。
从Demo中也不难看出,谷歌DeepMind这次没有继续使用此前长期合作的波士顿动力机器人,而是把模型部署到了多套不同硬件上,包括Apptronik的Apollo 2人形机器人、拥有22个自由度的Sharpa灵巧手,以及由两台Franka机械臂组成的双臂平台。
除了负责运动控制的VLA模型,谷歌还推出了Gemini Robotics ER 2,作为整套系统里的“高级大脑”。简单来说,如果Gemini Robotics 2负责“怎么动”,那么ER 2负责的就是“接下来做什么”。它会理解用户指令、观察周围环境,将复杂任务拆成多个步骤,再调用VLA模型逐步执行,并持续跟踪任务进度。
这次更新后,ER 2已经能够更稳定地处理持续数分钟、涉及数百次决策的长序列任务。它不仅知道任务何时开始和结束,也能识别拿起物体、完成放置等关键事件。如果中间某个步骤出现错误,机器人还可以重新观察环境、调整计划,再继续执行,而不是一次失败就直接停机。
此外,谷歌还展示了多机器人协作能力。不同类型的机器人可以相互传递任务信息、分工完成同一套工作流,从而处理那些单台机器人难以独立完成的复杂任务。换句话说,ER 2不直接负责控制机器人的每一个关节,而是站在更高层,负责规划任务、跟踪进度,以及调度不同的机器人身体。
最后是负责端侧部署的Gemini Robotics On-Device 2。它是谷歌目前效率最高的VLA模型,可以直接在机器人本地运行,避免网络延迟,也能适应工厂、户外等无法稳定连接云端的场景。
更重要的是,它原生支持多种机器人本体。借助从Gemini Robotics 1.5继承的“运动迁移”能力,On-Device 2通常只需要不到200个示例和几个小时的适配,就能迁移到一套新的双臂机器人上。即使新机器人的外形、传感器和自由度差异很大,这套方法依然可以工作。谷歌也在Dexmate、SO101和Trossen等不同平台上展示了这一能力。
整体来看,谷歌这次发布的三款模型分工相当明确:ER 2负责理解和规划任务,Gemini Robotics 2负责把计划变成全身动作,而On-Device 2则负责将这些能力快速装进不同的机器人身体里。
摩托车活塞环性能如何
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
Ondo将于今日上线股票永续合约
暗黑4S14野蛮人终局BD攻略
区块链OTC交易所有哪几家比较正规?
货拉拉如何查看历史订单 货拉拉往期行程轨迹查询【功能教学】
Binance新增15种bStocks代币化证券为杠杆抵押资产
Meme币DOGS今晚上线!开局就解锁91%代币是否带来风险?
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
赵云与阿斗神兵符使用教程 神兵符怎么使用
剑侠世界3雪峰论剑怎么打-剑侠世界3雪峰论剑打法介绍
余姚的路虎4s店在哪个位置
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
今日小鸡庄园答案2026.7.2
美债股纳斯达克首盘暴跌38%且加密代理交易解体,AVAX价格何去何从?
男生头像配网名可爱(精选100个)
国家养老服务消费补贴上线京东
英伟达机器人团队在京沪深招人,聚焦具身智能等四大领域
一站式PDF转Markdown解决方案PDF3MD
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc