来源:互联网 更新时间:2026-07-19 13:58
机器人也开始拥有所谓的“触觉想象力”了。
过去一年,随着具身基础模型的快速推进,机器人已经能完成不少轮廓清晰、位置明确的操作任务。可一旦碰到柔性物体、易损物体或需要密集接触的场景,机器人往往就开始力不从“脑”——或者说,力不从“芯”。
无论是捏起一颗葡萄而不让它破裂,还是抓住一只纸杯而不让它变形,视觉只能帮机器人找到目标。真正要完成操作,机器人还需要人类与物体交互时那种不可或缺的触觉感知。
正是因为这个原因,越来越多的团队开始把触觉作为建构机器人大脑的重要模态。比如,UniTouch、AnyTouch尝试统一不同传感器的触觉表征,FuSe、Tactile-VLA把触觉送入通用策略与VLA,近期的TacImag则开始探索让机器人仅凭视觉和本体感觉“想象”触觉;NVIDIA也推出了TacSL等视觉触觉仿真工具,加速触觉策略从仿真走向真机。
但这些路线各自仍有边界:传感器异构让数据难以互通,触觉的理解、生成与动作应用也往往分散在不同模型里。
最近,UniX AI(优理奇机器人)联合浙江大学、麻省理工、牛津、耶鲁以及上海交通大学,发布了最新科研成果UniTac,提出了一套统一的跨传感器触觉理解与生成架构,并进一步接入VLA,为机器人补上了“触觉想象力”。
(该工作已被ECCV 2026接收)
简单来说,UniTac让机器人获得了一种
对比来看,在未融合UniTac的情况下,VLA就会把纸杯捏扁。
这意味着,对于机器人来说,触觉第一次从“碰到以后才知道”,变成了碰到之前就能预测。而这背后,也对应着具身智能正在补上的一块重要能力:触觉。
如果把过去几年机器人基础模型的发展,看作一个不断把AI锚定到真实世界(grounding)的过程,那么大致可以分成三层。
VLM(视觉-语言模型)完成的是第一层grounding:把抽象的语言概念对应到现实世界,让机器人知道眼前看到的是什么。
VLA(视觉-语言-动作模型)再往前一步,把视觉语义和语言指令锚定到动作(轨迹),让机器人知道在任务场景中应该规划怎样的轨迹。
可当动作真正落地到物理世界时,往往还差着第三层grounding——
因为对于机器人来说,“抓取”只是一个动作标签,但现实里的每一次接触却完全不同。抓起一块毛巾,需要判断哪里更容易捏住,毛巾的材质、大小、形状、表面粗糙程度都会导致机器人抓错或抓取失败。例如,在未接入UniTac时,VLA就无法抓起下图所示的橙色毛巾。
也就是说,真正决定机器人操作成功与否的,不只是轨迹,而是
完全依赖视觉,机器人很容易对外观相似的物体采用同一套操作策略。而且如果等到接触发生后再根据触觉反馈修正,纸杯可能已经瘪了,薯片也可能已经碎了。所以,如果机器人能够在真正碰到之前,就已经知道未来的触觉状态,那么第一次接触就会变得安全得多。
为了实现这一点,UniTac先从大规模、多传感器数据中学习统一的触觉表征,再根据视觉信息预测潜在触觉状态,把触觉从“接触后的反馈”前移成“接触前的先验”,并送入VLA。值得一提的是,这并没有取代接触后的实时反馈,而是在第一次下手之前,让机器人先预判这次接触可能带来的物理后果。比如,在同样面对两块看起来差不多的毛巾时,基于UniTac的基础模型,就能提前预判毛巾的质感、颜色,从而规划、完成毛巾的单层抓取动作。
接下来,具体来看UniTac是怎么做到的。
为了让触觉进入基础模型,UniTac先处理了最难统一的数据问题。
触觉图像虽然看起来很像RGB图像,但产生方式却完全不同。以GelSight、DIGIT、Duragel等视觉式触觉传感器为例,它们本质上是通过相机记录凝胶受压后的形变。
所以,一张触觉图像里通常混着两类信息:一类来自物体,包括硬度、粗糙度、纹理和接触形变;另一类来自传感器,包括光照、凝胶状态、Marker布局和相机参数。这意味着,同一个物体,换一种触觉传感器,得到的数据可能完全不同。模型如果分不清哪些变化来自物体、哪些来自传感器,就很难实现跨设备泛化。
与此同时,过去的触觉模型大多建立在单一传感器或小规模数据集上。比如PHYSICLEAR只有482段触觉视频,而整个社区其实已经公开了超过40万段触觉视频、160万帧数据。这就是说,真正的问题并不是没有数据,而是这些数据长期分散在不同传感器、不同数据集和不同任务中,无法被统一利用。
为解决这些问题,UniTac把触觉理解和触觉生成放进同一个多模态框架,统一吸收来自不同传感器的数据。具体来说,UniTac将触觉拆分成两个部分:物理属性和传感器配置。前者描述物体在接触中呈现出的硬度、粗糙度和纹理等属性;后者刻画传感器的光照、凝胶状态、Marker布局和相机参数等配置。而UniTac的整体架构,就围绕这两方面展开。
在
在
最后,实验结果进一步表明,UniTac并非只在某项指标上实现单点领先,而是在触觉理解与触觉生成两端都展现出优势。
在触觉理解方面,UniTac-7B在PHYSICLEAR-Test上以66.51分领先Octopi等触觉理解模型,以及BLIP3o等统一模型。具体来说,在属性—物体匹配任务中,UniTac-7B取得64.61分,说明它不仅能识别软硬、粗糙度等物理属性,还能进一步判断触觉来自哪类物体。
在触觉生成方面,UniTac同样表现优异。面对Digit、GelSight、GelSight Mini和Duragel四类传感器,UniTac的平均SSIM和PSNR分别达到
正是这种稳定的跨传感器生成能力,让它可以进一步为VLA提供触觉先验,帮助机器人判断该怎样更安全地接触目标。
最后,把视角拉回到UniTac背后的团队——优理奇机器人(UniX AI)。这家全栈式具身智能公司由00后耶鲁博士杨丰瑜,于2024年4月创立于苏州。
在UniTac论文中,杨丰瑜担任共同一作,延续其在视触觉方向的技术路线。另一位共同一作Jiahang Tu来自浙江大学,研究集中在计算机视觉与生成模型;通讯作者Hanbin Zhao现任浙江大学助理教授,长期从事机器学习、计算机视觉和生成模型研究;来自UniX AI的Zhi Tao,则侧重真机算法与系统落地。此外,论文作者还包括牛津大学的Chenyang Ma、MIT的Xihang Yu、耶鲁大学的Ziyao Zeng与Alex Wong,上海交通大学的Shaokai Wu等多位研究者,研究背景覆盖触觉表征、生成模型、VLA和真机操作。
把时间线往前拉,优理奇围绕触觉展开的路线已经相当清晰。从Touch and Go采集真实世界的视触觉数据,到UniTouch统一多传感器表征,再到TaRF把视觉与触觉对齐到三维空间,团队始终在推进同一件事:
最新的UniTac则把这条路线继续推向基础模型,将触觉理解、生成和跨传感器迁移纳入统一架构,并把预测到的触觉状态接入到像VLA这样的机器人基础模型上。这一步也延续了优理奇一向的场景驱动思路。从其产品与技术演进来看,团队关心的不只是机器人“能不能干活”,还包括能否把活干好、干得更稳定高效。与其针对每个场景微调,不如从真实任务的痛点出发,持续补齐感知、控制与系统能力。
因此,当行业集中攻关VLA和世界模型时,优理奇选择补上的是机器人进入物理世界时绕不开的接触层。UniTac的意义,
在未来,随着视觉、触觉、力觉与动作模型进一步融合,机器人有望在家庭护理、精细装配、服务操作和康养陪护等场景中,完成更安全、更柔顺的接触操作。
参考链接:[1]https://arxiv.org/abs/2606.31451
七麦数据官网网页地址 七麦数据官方入口在线首页
问卷星官方网站入口地址 问卷星网页版在线使用
币安Binance官方中文网站 币安App最新版下载及新手注册指南
闲鱼的严选验货在哪里看?闲鱼严选和验货宝哪个可靠
PokePay加密卡2026完整指南:申请开卡全攻略+多场景应用技巧
淘宝直播如何看回放在哪里看?怎么查看淘宝直播回放
摩托车活塞环性能如何
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
迷你网名古风男生霸气(精选100个)
文雅简易网名男生可爱(精选100个)
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
《梦幻西游》特殊鬼怪怎么抓-隐藏变异鬼应对要点
索尼限时赠送PS Plus Premium七日会员,需手
豆包AI专业版使用教程【新手必看】
王者荣耀「西行封妖记」【孙权-仙扇使者】6月25日上线!
闲鱼严选和验货宝哪个可靠?闲鱼的验货宝怎么样,,
币圈十大实用工具:从实时行情监控到数据分析、资产管理
币安杀入美股市场,重头戏bStocks还没来
陈姓和杨姓网名大全男生(精选100个)
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc