来源:互联网 更新时间:2026-07-07 15:03
人类学一件灵巧的操作,靠的什么?说到底,是从“看”开始的。
孩子看别人打蛋、倒水、钉钉子,慢慢地就学会了。但机器人不一样,它想学点新活儿,主要还是得靠“做”——要么花大价钱搞遥操作,要么在仿真里跑无数遍,要么就在精心布置的实验室里一遍遍地采集真机数据。
其实,能让机器人“看”的东西早就堆积如山了。YouTube、第一视角数据集、各种生成式视频里,满满都是人手和各种物体打交道的素材。真正的短板在哪?不是缺数据,而是缺一个关键步骤:怎么把这些充满噪声的单目RGB视频,转化成多指灵巧手能直接拿来用的动作轨迹?
UC Berkeley的团队就是在这个问题上打了一场硬仗。他们跑通了整条链路:从真实场景的普通视频里,先重建出4D的手-物交互过程,再把这些交互轨迹重新映射到拥有22个自由度的Sharpa Wa ve灵巧手上。这是第一条真正能从网络视频直接生成灵巧手执行轨迹的完整路径。

这条路径生成了500条经过验证的轨迹,覆盖了20类操作动作,最终在双UR3e机械臂+双Sharpa Wa ve平台上,以50Hz的频率成功部署了10个真实任务。

要把灵巧机器人的数据规模化,有三座大山绕不过去。
真实场景视频里,运动模糊、遮挡、深度信息缺失,都是家常便饭。物体种类还千奇百怪。像FoundationPose这样的跟踪方法,一遇到轻微模糊,位姿就丢了。而那些联合重建方法呢,要么太依赖实验室环境,要么只能处理事先设定好的那几类物体。没有稳定的4D手-物重建,人类视频对机器人学习来说,基本就是睁眼瞎。
之前的动力学感知动作重定向方法,比如SPIDER或者基于强化学习的跟踪,都默认输入是干净的MoCap真值数据。但现实很骨感——从网络视频里重建出来的参考轨迹,哪能那么干净?时间上可能不连续,接触关系乱七八糟,甚至一开始的初始状态就物理上不合理。这些问题一传导到后续优化,就全炸了。论文里的实验数据很说明问题:直接用基于采样的优化方法处理这种带噪声的轨迹,失败率能飙到75%。
遥操作确实能拿到真实的机器人数据,但成本太高了。得靠专业操作员、专用设备,还得一个任务一个任务地采集。想靠遥操作来覆盖一小时人类做饭视频里的那些丰富操作,已经是难上加难,更别提覆盖整个互联网上海量的人类视频了。
所以Do as I Do想回答的核心问题很明确:只靠单目RGB视频,不预设抓取模式,也不限定物体类别——机器人能不能从“看见”真正走到“做到”?

Do as I Do的流程,分两步走。
SAM 3D能为一帧图像生成物体网格,但如果一帧一帧单独处理,结果就很容易飘,时间连续性也保不住。Do as I Do的做法是,先选一个锚定帧,在这一帧里把物体形状固定下来。然后在后续帧的流匹配去噪过程中,让当前帧的位姿采样结果向上一帧靠拢。这样一来,物体形状始终一致,位姿轨迹也连续多了。同时,系统会根据2D点跟踪估计出的物体旋转速度,自适应地调整位姿,避免跟踪得太死板,也减少不必要的错误翻转。
在150个真实场景视频的人工对比评估中,评估者在67%的样本里认为Do as I Do的跟踪结果优于FoundationPose。而且很多样本里,多位评估者给出了完全一致的判断。
Do as I Do在SPIDER的采样/MPPI优化框架基础之上,又加了三个关键设计,专门对付从网络视频重建出来的那种“脏”轨迹。


这些改进综合下来,Do as I Do在带噪声的真实场景参考轨迹上,将动作重定向成功率从25%拉到了71%。



最终覆盖了20类操作动作。这些动作绝不是简单的拿或放,而是更贴近人类日常生活的复杂操作:放置、拿取、擦洗、涂抹、挤压、熨烫、刷涂、除尘、挖掘、擦除、倾倒、书写、搅打、搅拌、戳刺、压实、钻孔、锤击、切割、刷酱汁。

这些轨迹没有只停留在仿真里。研究团队从中挑了10项代表性动作,搬到了双UR3e机械臂+双Sharpa Wa ve灵巧手平台上,以50Hz的控制频率完成了真机执行。
这10个动作覆盖了不同的物体形状和多种抓握方式:书写式三指抓握、力量抓握、掌侧抓握和平行伸展抓握。
Sharpa Wa ve有22个自由度,尺寸接近人手,所以特别适合作为人类手部动作迁移的目标。像搅打、搅拌、锤击这种需要双手配合的操作,传统平行夹爪根本搞不定。而Wa ve超过4Hz的手势切换频率和50N的指尖力,刚好能撑住这些动作的力度和速度。

从重建、仿真(MuJoCo Warp,200Hz)到真实部署,研究团队都把Sharpa Wa ve当作动作重定向的目标手型,把人类视频里的操作轨迹迁移到这个本体上。EgoScale同样将人类手部关键点重定向到这个手型,CAIP则在Dexmate Vega加双Wa ve平台上进行了评估验证。因为目标手型更像人手,系统在把人类动作迁移到机器人上时,要跨越的形态鸿沟自然就小得多。
对那些想规模化利用人类视频数据的团队(包括做EgoScale这类方向的团队)来说,Do as I Do还给出了一条很实际的提醒:视频不是越多越好,能不能筛出可用数据,跟数量一样重要。
研究团队分析了100DOH数据集里的2000个10秒视频片段(这些已经过手-物交互筛选了):

结果相当直接:如果不对原始视频做预处理,直接把网络视频扔给机器人学习,真正能用的数据可能只有大约二十分之一。所以Do as I Do总结了一套数据筛选要点:检查手和物体是否一直在画面里,确认动作有没有跨越镜头切换,排除相机运动过大的片段,识别SAM 3D可能失败的情况。对于任何想在灵巧手上打通“人类视频到机器人执行”这条路的团队来说,这套筛选流程都将是绕不开的基础环节。
在过去很长一段时间里,“Do as I Do”更像是AI圈的一个理想——让机器人看懂人类示范,然后把这些动作迁移到自己的“身体”上。而现在,UC Berkeley的这个研究正把这个理想拉进现实:输入一条视频链接,系统就能重建其中的手-物交互过程,再把它转化为Sharpa Wa ve能执行的22个自由度关节轨迹。
某种意义上,世界上最大的操作数据集其实早就存在——它们就藏在每天被人们拍下、上传、分享的视频里。Do as I Do要做的,就是把这些视频,变成灵巧手能真正用起来的东西。
观看,重建,重定向,然后执行。
问卷星官方网站入口地址 问卷星网页版在线使用
币安Binance官方中文网站 币安App最新版下载及新手注册指南
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
豆包AI专业版使用教程【新手必看】
摩托车活塞环性能如何
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
迷你网名古风男生霸气(精选100个)
文雅简易网名男生可爱(精选100个)
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
陈姓和杨姓网名大全男生(精选100个)
网名开头英文名字男生(精选100个)
区块链存储板块是什么?有哪些?一文详解
暗黑4S14野蛮人终局BD攻略
Ondo将于今日上线股票永续合约
免费网络收音机软件有哪些?高评分收音机APP推荐
时隔一个多月,Dify v1.15.0终于发布了!
郑好办app如何查询档案 郑好办app查询档案方法
电视剧《罗曼诺夫后裔》剧情介绍
迅雷云盘如何下载到本地速度最快
如何在火狐浏览器中彻底禁用自动更新功能?
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc