网易首页 > 网易号 > 正文 申请入驻

李飞飞第一篇「触觉」论文:机器人会盲摸麻将了

0
分享至


文章转载于量子位

作者:贾浩楠

嚯!这阵容,谁组的局?


李飞飞,ImageNet奠基人,美国三院院士;

Trevor Darrell,伯克利BAIR联合创始人,他的Caffe深度学习框架曾是计算机视觉领域最广泛使用的平台之一;

Jitendra Malik,R-CNN的核心贡献者之一,深刻影响了计算机视觉的发展轨迹,同样美国三院院士;

Pieter Abbeel,深度强化学习先驱,伯克利机器人学习实验室主任、BAIR实验室联合主任。ACM计算奖得主;

Ken Goldberg,机器人学泰斗,30年前就深耕机器人抓取和自动化,IEEE会士;

Jim Fan,英伟达GEAR实验室掌舵者,具身智能领域最受瞩目的年轻学者之一。

具身智能学术圈,可能是第一次迎来如此全明星阵营。

有模型的、算力的、本体的、数据的等等…..在各自细分赛道上如雷贯耳的big name们,齐聚具身智能,但关注点嘛~一下就让人好奇起来:

不是当下大热的机器人通用大脑,而是——灵巧手

1

T-Rex从何而起,要解决什么问题?

自动驾驶靠纯视觉,是有可能解决问题的,但机器人,尤其是灵巧手却很难。

这是一个直观且浅显的事实:

手指、手掌进行精密复杂操作时,很难只用摄像头记录运动数据

360°无死角的视频数据量有多庞大暂且不说,首先机位就没法布置。不同任务类别,很难像自动驾驶那样形成标准化数据集——模型泛化性受限。

自然而然,给模型加入触觉这个数据模态,就成了一石三鸟的方法:感知精度更高、操作更精准细腻,以及可以形成较为标准的数据集。


但反常识的事情出现了:

同样的灵巧手、同样的任务,T-Rex团队把触觉力信号直接拼接到一个预训练好的VLA模型里,想给它“加点手感”——结果任务成功率从17%掉到了6%。

触觉不是想加就能加的,论文把原因拆成了三层。

第一层,数据太贵。

现有的大规模机器人数据集主要面向平行夹爪——两根手指一捏一放,遥操作门槛低。但灵巧手有22个自由度,操作员要戴数据手套,每一个手势都要精确映射到机械手上,还要保证视觉、触觉、关节状态严格对齐,目前灵巧手遥操作成本是平行夹爪的5到10倍。

第二层,频率对不上。视觉模型处理一帧图像动辄几百毫秒,只能跑到5到10Hz。但触觉反应需要毫秒级,20Hz以上才能捕捉到“正在滑”和“已经滑了”的临界点。

两种信号塞进同一个低频Transformer,视觉来不及看,触觉来不及反应。


第三层,表征太浅。很多方法把触觉当成一个静态的数字——“当前压力5牛顿”。但触觉本质是时序信号:滑动、插入、按压、搓动,每种接触状态都有力随时间变化的独特模式。

好,问题在这里,先看看T-Rex团队解决的怎么样。

在12项真实世界的灵巧操作任务上,T-Rex平均成功率达到65%,比最强纯视觉基线的35%高出了30个百分点。

翻书页96%对68%,开锁70%对0%——纯视觉方案在这个任务上完全被碾压。

消融实验更直接:把T-Rex的触觉输入全部拿掉,成功率从65%掉到42%,降了23个百分点——12项任务里超过三分之一的有效操作纯靠“手感”撑着。

数据效率也很惊人:仅给10条微调演示时,经过中期训练的T-Rex能达到约40%成功率,没经过中期训练的模型直接归零。

这说明模型不是“背下了”数据,而是真正理解了“搓”“捏”“拧”这些动作的通用手感。

一句话总结:视觉数据对灵巧手来说,本质上是不够用的——触觉不是锦上添花,而是必选项。

谁先解决“触觉怎么加”的架构问题,谁就可能在灵巧手这个赛道上卡住位置

1

怎么做到的?

T-Rex的核心思路并不复杂——给触觉单独开一条高速通路,而不是让它和视觉挤在同一条慢车道上。

整体架构叫Mixture-of-Transformer-Experts,三个专家分工明确。


Latent Expert处理视觉和语言,预测未来的视觉表征,相当于给模型提供一个“接下来会发生什么”的大局感。

Action Expert做低频动作规划,参数量1.41B,是三个专家里最大的那个,跑一次管一个动作块。

Tactile Expert做高频触觉精修,参数量只有0.62B,轻量到可以频繁触发。

关键机制是Cascaded Flow Matching:

扩散去噪通常需要10步才能从一团随机噪声变成一个干净的动作轨迹,而T-Rex在第4步处一切两半:

前6步由Action Expert完成,生成一个“大方向对了但缺乏手感细节”的半成品;后4步由Tactile Expert接手,注入实时触觉数据完成精修。

为什么是第4步?作者团队通过实验对比发现太早切,Action Expert去噪步数太少,继承不了大规模人类视频预训练获得的先验知识;太晚切,动作分布已经定型,触觉信号进来也来不及修正了。


第4步刚好处在“该有的形状都有了,但细节还能改”的黄金位置。

这就像写文章:主编(Action Expert)定好大框架后就去忙别的了,四个编辑(Tactile Expert)在不同的节点上轮番检查细节,不需要主编每次都回来重看一遍全文。

触觉信号怎么编码是另一个关键设计。

触觉传感器有零点漂移和高频噪声,直接拿原始电压值喂给模型,模型很可能把传感器噪声当成接触特征学进去。

T-Rex用VQ-VAE把过去16帧(约0.5秒)的力历史压缩成64个离散码字。不同接触状态——按压、插入、滑动——会被自动聚类到不同的码字上。

这样一来,传感器漂移被过滤掉了,触觉信号还变得可解释——你能看到模型“理解”了什么类型的接触。


两个工程细节,第一个:让码本“活起来”。 VQ-VAE码本,理训练时经常出现“码本坍塌”——大部分抽屉空着,少数几个塞满各种杂乱状态。T-Rex的做法是定期检查哪些抽屉闲置,主动塞点数据进去“激活”它,确保所有码字都被利用起来。

第二个,给“有手感”的时刻更高权重。 避免模型化90%的精力去学好“零接触”这个最容易学的状态,而忽略真正有价值的接触瞬间。T-Rex给高力帧更高的学习权重,让模型把算力集中在关键接触点上。

论文正文不会写、但做灵巧手工程化的人一看就懂。

最后是训练策略。

T-Rex采用三阶段训练:

先在大规模人类视频上预训练(22,889小时),让模型看懂“人是怎么动的”;

再用100小时遥操作数据做中期训练,覆盖207种物体和22种动作基元——目的是把人类视频里的运动知识迁移到机器人本体上,而不是死磕某个具体任务。

最后用约100条任务演示做后训练,快速适配特定需求。


其中最核心是中期训练,解决了一个根本问题:人手抓杯子的方式和机械手抓杯子的方式不一样,策略不一样,受力反馈也不一样。如果直接拿人类视频训练出来的模型去操控机器人,它不知道怎么把“看来的”转化成“做出来的”。

中期训练就是用100小时的遥操作数据,把这道鸿沟填上。它不是让模型死磕某一个具体任务,而是让模型接触207种物体和22种动作基元的组合,理解“搓”这个动作在不同物体上应该怎么执行、“捏”这个动作需要多大的力。

这就像一个人学完游泳理论后,在浅水区把蛙泳、自由泳、仰泳都练了一遍——不追求速度,只追求“会用”。

有了这个基础,最后阶段只用100条任务演示就能快速适配——因为模型已经知道“手感”是什么了,只需要知道“用在哪儿”。

T-Rex的技术路线清晰指向一个判断——视觉和触觉在灵巧操作中不是主从关系,而是并行关系。

它用一个异步架构解决了频率不匹配的底层矛盾,用一套时序编码把漂移的传感器信号变成了可解释的离散词汇,用一组基元组合的覆盖策略替代了特定任务的深度堆叠。

这三件事单看都不是“发明新数学”,但组合在一起,为灵巧手的触觉利用提供了一套可复用的系统方案。

1

灵巧手,存在一个“第一性原理”吗?

灵巧手赛道眼下最热闹的争论,集中在两个地方:关节运动形式和自由度数量。

腱绳还是连杆?丝杠还是齿轮?11个自由度够用还是得干到27个?不同厂商各执一词,技术路线远未收敛。

这些争论当然都有意义——传动方案决定成本、可靠性和使用寿命,自由度决定灵巧程度的上限——但学术前沿的核心关注,不在这些问题中的任何一个上面。

因为一个更深层的问题很少被讨论:有了这些硬件,算法能不能用好?

传统大模型范式几乎以视觉数据为主,没有针对触觉模态的有效利用方案。T-Rex论文里那个17%掉到6%的实验,恰好说明了这一点——不是触觉没用,是现有多模态大模型架构消化不了触觉。


T-Rex团队的探索最大价值可能在这里: 跳出硬件参数的争论,回到一个更根本的问题——灵巧手做精细操作,到底需要什么数据?

关节形式和自由度数量解决的是“能不能动”的问题,触觉数据解决的是“能不能感知和反应”的问题,由此衍生出需要什么样的触觉数据这个体系化问题,并给出了一个能泛化的方案。

当然,T-Rex这项研究得以完成,一个关键前提是Sharpa Wave提供的硬件基础——22个自由度、180Hz高频触觉信号、稳定的传感器输出。

灵巧手的硬件天花板顶高了,T-Rex才得以在算法层面去够这个上限。

反过来,T-Rex的算法探索也给硬件提出了新要求:手掌区域需要触觉感知,不同传感器的数据格式需要统一。

T-Rex的软件、SHARPA的硬件探索方向,后续可能会给这个细分领域带来更深刻的变化。

首先灵巧手可能从具身智能本体中分化出来,成为一个独立赛道——占整机成本15%到20%,经济上可行,技术上门槛也足够高。


但如果触觉数据成为核心壁垒,灵巧手就不仅仅是执行器,而是整个感知-决策-执行链条中数据价值最高的一环。谁掌握触觉数据的采集能力和模型训练能力,谁就掌握了议价权。

第二个变化,更多专用场景的具身应用可能被启发。当前具身智能的主流叙事是“通用”——一个模型解决所有任务。

但这个叙事在接触密集型任务上遇到了困难,因为通用数据里触觉是缺失的。T-Rex则证明的是另一种可能性:在一个足够具体的垂直场景里,用专用的数据模态(触觉)、专用的架构设计(异步级联)、专用的数据收集策略(基元×物体),可以取得比“通用”方案好得多的效果。

这条路径如果走通,会启发更多人去寻找类似的高价值专用场景。

T-Rex的贡献不是发明了“新数学”,而是把现有工具组合成一套可用的系统方案,试图建立具身智能触觉数据统一的采集、训练范式,推动灵巧手真正scale up起来。

项目地址:https://tactile-reactive-dexterous.github.io/

1

作者简介

牛丹彤,UC Berkeley PhD Candidate,NVIDIA Gear Lab实习生,导师Trevor Darrell,主要从事具身灵巧手大模型的研究,曾以第一作者或共同第一作者身份在CVPR, ICML, ICLR等国际顶级会议上发表论文8篇,领导或主要贡献T-Rex,EgoScale等工作,目前谷歌学术引用1100+。

刘卓洋,北京大学元培学院本科生,导师仉尚航,目前在UC Berkeley访问,导师Trevor Darrell,主要从事具身多模态推理大模型方向的研究,曾以第一作者或共同第一作者身份在ICML, ICLR, NeurIPS, ICRA等国际顶级会议上发表论文6篇,其他参与论文共计15篇,目前谷歌学术引用400余次。曾获2026商汤奖学金(全国30人),2025北京大学学术新星提名,北京大学元培学院年度科研奖励,北京大学新生奖学金等。

Trevor Darrell教授,最广为人知的成果是开发了Caffe深度学习库。这个库在深度学习领域具有重要的地位,为众多的研究人员和开发者提供了便捷的工具,极大地推动了深度学习技术的发展。

Trevor Darrell现在是加州大学伯克利分校Berkeley DeepDrive研究中心的主任。同时担任伯克利EECS系计算机科学分部的教职,并受聘于加州大学附属的国际计算机科学研究所(ICSI)。研究方向涵盖大规模感知学习算法,包括物体与行为识别及检测,并应用于机器人及移动设备的多模态交互等多种场景。他的研究兴趣包括计算机视觉、机器学习、计算机图形学以及基于感知的人机交互界面。

点个爱心,再走 吧


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
皇马将西藏与尼泊尔并列拒绝改正

皇马将西藏与尼泊尔并列拒绝改正

第一财经资讯
2026-09-02 00:11:54
原切牛肉检出瓜尔胶:大厂为何会踩这条红线

原切牛肉检出瓜尔胶:大厂为何会踩这条红线

思考不息
2026-09-02 14:41:23
上海老教授夫妇从21楼坠下,床上摆180万元现金,还有多位有名有姓的当事人?官方辟谣:AI写的

上海老教授夫妇从21楼坠下,床上摆180万元现金,还有多位有名有姓的当事人?官方辟谣:AI写的

极目新闻
2026-09-02 12:32:29
十七年油电更迭,为何说汽车业的风口从未转向

十七年油电更迭,为何说汽车业的风口从未转向

车云网
2026-09-02 21:04:28
西方情报头子警告:普京已陷入绝境,俄罗斯政权可能一夜变天

西方情报头子警告:普京已陷入绝境,俄罗斯政权可能一夜变天

民间胡扯老哥
2026-09-02 07:18:33
谁干的?俄罗斯军官被斩首,美英法集体沉默,普京连下三条命令

谁干的?俄罗斯军官被斩首,美英法集体沉默,普京连下三条命令

闻识
2026-09-02 11:17:04
泰国真是太损了!美军五千官兵在航母上憋了200多天,终于要上岸休整了,结果泰国抢先动手连夜清查,几十名涉非法色情行业的人员被带走

泰国真是太损了!美军五千官兵在航母上憋了200多天,终于要上岸休整了,结果泰国抢先动手连夜清查,几十名涉非法色情行业的人员被带走

扶苏聊历史
2026-09-02 15:26:46
“狗不理”跌落神坛,从一天卖6万个到无人问津,为什么不火了?

“狗不理”跌落神坛,从一天卖6万个到无人问津,为什么不火了?

史之铭
2026-09-02 02:14:50
A股:今晚2.5亿股民,要兴奋到睡不着觉了,你知道为什么吗?

A股:今晚2.5亿股民,要兴奋到睡不着觉了,你知道为什么吗?

夜深爱杂谈
2026-09-02 19:22:40
美军“林肯”号航母即将停靠泰国芭提雅,美方告诫官兵不得参与非法性交易,不得进大麻商店消费;泰方紧急“扫黄”,逮捕四五十名违法人员

美军“林肯”号航母即将停靠泰国芭提雅,美方告诫官兵不得参与非法性交易,不得进大麻商店消费;泰方紧急“扫黄”,逮捕四五十名违法人员

极目新闻
2026-09-02 09:32:23
揪心!西藏吉隆口岸被抹平,已发现:失联人员被深埋在巨石淤泥下

揪心!西藏吉隆口岸被抹平,已发现:失联人员被深埋在巨石淤泥下

胡侃社会百态
2026-09-02 12:56:20
星宇董事长亲自道歉!看似句句诚恳,实则敲打举报人,舆论再反扑

星宇董事长亲自道歉!看似句句诚恳,实则敲打举报人,舆论再反扑

鲸探所长
2026-09-02 16:40:24
碧桂园出事比恒大问题更大,看许家印落狱,杨氏父女疯找活路

碧桂园出事比恒大问题更大,看许家印落狱,杨氏父女疯找活路

赶鸭子上架
2026-09-02 12:37:08
200亿龙头,被107个应届生上了一课

200亿龙头,被107个应届生上了一课

凤凰网财经
2026-09-01 23:50:47
孔绍逊履新代省长!多个省级政府领导班子有调整

孔绍逊履新代省长!多个省级政府领导班子有调整

上观新闻
2026-09-02 13:22:40
金价,快速下跌

金价,快速下跌

中国基金报
2026-09-02 11:05:26
难怪朱倩老公这次下手这么狠,这女人的聊天记录,实在是太野了

难怪朱倩老公这次下手这么狠,这女人的聊天记录,实在是太野了

皮蛋儿电影
2026-09-02 10:26:48
深圳校服火“出圈”!全市统一,企业自由竞争,价格杀到几十元

深圳校服火“出圈”!全市统一,企业自由竞争,价格杀到几十元

界面新闻
2026-09-01 21:46:36
29分惨败!女篮世界杯前夕遭当头一棒:韩旭回归却被法国队打爆了?

29分惨败!女篮世界杯前夕遭当头一棒:韩旭回归却被法国队打爆了?

篮球快餐车
2026-09-02 18:01:54
“希望4个老人长命百岁”,女子晒3万多退休金,普通人的心却凉了

“希望4个老人长命百岁”,女子晒3万多退休金,普通人的心却凉了

番外行
2026-09-02 15:33:01
2026-09-02 21:56:49
硅星人 incentive-icons
硅星人
硅(Si)是创造未来的基础,欢迎来到这个星球。
3372文章数 10529关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

7人豪宅楼盘看房被困电梯呼叫铃还无反应 售楼部回应

头条要闻

7人豪宅楼盘看房被困电梯呼叫铃还无反应 售楼部回应

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

全新理想MEGA售50.98万 这一次“移动的家”更舒适更灵活

态度原创

时尚
房产
游戏
手机
教育

白衬衫不火了?早秋穿“棕色衬衫”更高级好看

房产要闻

新四代住宅 新样板间开放丨以艺术之名 赴一场迭代之约

《GTA6》新截图暗示坏结局?主角穷途末路 绝境相拥

手机要闻

OPPO ColorOS 17官宣采用全新「渐进式运动」效果

教育要闻

不要给孩子太多消费性快乐

无障碍浏览 进入关怀版