网易首页 > 网易号 > 正文 申请入驻

NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026

0
分享至


给生成模型引入仿真,补上难以获得的声音感知。

作者丨张岂萍

编辑丨幸丽娟

机器人要进入真实世界,需要处理的信息远不止视觉。

倒水时,声音可以帮助判断杯子是不是快满了;物体发生碰撞时,不同材质会发出不同的声音;一个人在小房间和大房间里说话,空间回声也不一样。然而,这些人类习以为常的多模态感知,以及诸如切苹果、叠杯子这类极其复杂的双手灵巧操作,在机器人的训练阶段却面临着极其高昂的“数据采集壁垒”。

当机器人需要的数据很难直接采集,传统物理仿真又补不全这些信息时,还有没有别的办法?

在 ECCV 2026 主题为“Visual Perception and Reasoning in the Interactable World”的Workshop上,NVIDIA Research 科学家、UC Berkeley 研究者李柏依(Boyi Li)通过线上连线分享了她近期在这一方向上的两项工作。

她博士毕业于康奈尔大学,师从 Serge Belongie 与 Kilian Q. Weinberger,之后在 UC Berkeley 与 Jitendra Malik、Trevor Darrell 开展研究,目前研究重点包括具身智能中的高效多模态、泛化建模和交互智能系统。

面对这些难以直接采集的数据,她尝试了两条不同的路径:模拟器里没有的声音,可以“生成”出来;机器人身上昂贵的操作数据,也可以从人类视频里获得。

第一条路径是MultiGen。传统物理模拟器已经可以模拟相当逼真的倒水过程,却没有与画面同步的声音。李柏依团队利用现实世界中的视频和音频训练生成模型,再让它为仿真视频补上对应的声音。她将这个思路概括成一句话:“Don’t just simulate physics – generate perception”不只模拟物理过程,还要生成感知

另一条路径是DexImit。与其大量采集昂贵的双手机器人示范,团队尝试利用人类操作视频,恢复其中手与物体的交互,再将这些交互转化为机器人能够学习和执行的双手操作数据。

一个补上仿真世界里缺失的感知,一个把人类操作转化为机器人可以学习的示范。背后的思路是一致的:机器人训练需要的,不只是把物理世界模拟得更真实,还要把那些难以直接获得的感知和交互信息,变成机器人可以学习的数据。

以下是李柏依的演讲分享,AI科技评论根据其演讲内容进行了不改原意的编辑:


Efficient Multimodal Intelligence for Embodied Agents in Interactive Worlds(交互世界中的具身多模态智能)

01


机器人为什么需要“听见”世界?

我们一直在研究多模态系统。

现在的多模态已经不只是图像和语言,还包括 3D 几何、声音、嗅觉和触觉等信息。这些模态可以帮助模型进行泛化和推理,也可以用于机器人、医疗等真实场景。

今天我主要分享其中两个与机器人有关的工作。

先从声音开始。

我们先来看一个很有意思的任务。假设现在有一根水管正在往瓶子里倒水,你需要判断什么时候水会溢出来。如果没有声音,只看水管里的水流,其实很难判断瓶子里面发生了什么。

如果把声音加进来呢?

其实在日常生活中,我们一直在利用声音理解周围发生的事情。比如烤肉的时候,我们可以通过声音判断它的状态;玻璃碎了、门打开了、可乐被打开了、水烧开了,我们也可以通过声音知道发生了什么。

声音还能提供空间信息。在小房间、大房间,甚至更大的空间里说话,声音听起来都会不一样。它也可以帮助我们判断物体的材质和状态。比如洗碗的时候,不同材质的杯子、瓶子和盒子会发出不同的声音;有时候我们还会摇一摇薯片罐,通过声音判断里面是不是还有东西。

那机器人能不能也利用声音?

我们希望训练一个机器人策略,让它同时利用视觉、物理信息和声音,更准确地执行任务。要做到这一点,我们首先需要多模态数据。

但真实世界里的这类数据很难采集。

那 simulation 呢?现在的物理模拟器已经可以生成非常逼真的视觉效果。比如倒水,我们能够看到整个物理过程,看起来已经很真实了。

问题是,没有与画面对应的声音。


如果要训练同时利用视觉、物理信息和声音的机器人策略,我们就需要包含这些信息的多模态数据,而且不同模态之间还要彼此对应。现有的物理模拟器没办法提供这样的音频。

那这些声音从哪里来?

02


MultiGen:

不只模拟物理,还要“生成感知”

我们开始重新看已经拥有的数据。

现实世界里其实有大量同时包含视频和声音的数据,比如 YouTube 等来源的视频。我们把这些视频收集起来,作为In-the-Wild Data

我们的目标是训练一个Audio Generative Model:给模型一段视频,让它生成与视频内容对应、并且在时间上对齐的声音。我们选择 diffusion model 作为基础模型,在训练时输入视频,让模型学习生成对应的音频。


训练完成之后,我们发现这个模型对不同的视频内容有比较好的泛化能力。给它一段视频,它能够生成与画面对应的声音。

接下来,我们把物理模拟器生成的视频输入这个模型,让它生成对应的声音。这样,模拟器负责生成视觉信息和机器人的物理轨迹,生成模型负责补上音频,最后得到一套Simulated Multimodal Dataset


有了这些数据之后,我们就可以进一步训练同时利用视觉和声音的 Multimodal Robot Policy,再把它部署到真实环境中。

我们测试了不同的容器和液体。比如把液体倒进不规则的容器,机器人需要自己判断什么时候停止;换成可乐之后,声音和音高都发生了变化,但机器人仍然可以完成倒水任务。

我们还测试了环境变化。比如在倒水过程中把灯关掉,让视觉受到干扰,机器人仍然能够继续完成任务。我们也加入了背景噪声,在比较嘈杂的环境里,策略仍然能够识别倒水的声音。

为了进一步验证效果,我们比较了两种策略:一种只使用视觉,另一种同时使用视觉和声音。

先看不透明容器。因为无法直接看到容器内部的液体状态,只使用视觉时误差比较大;加入声音之后,误差明显下降。

我们也测试了透明容器。即使在这种情况下,视觉本身已经能够提供更多信息,加入声音之后,性能仍然有所提升。


我们还做了一个更直接的对比实验。两组实验保持完全相同的设置,一组机器人只使用视觉,另一组同时使用视觉和声音。倒水过程中,我们把灯关掉,等机器人判断应该停止之后,再把灯打开。

只使用视觉的时候,水已经溢出了杯子。

机器人在感知上其实非常脆弱。一旦视觉受到干扰,整个系统就很容易失效。在这种情况下,声音可以发挥很重要的作用,帮助系统变得更加鲁棒。

这也是我们最后想表达的:“Don’t just simulate physics – generate perception.”

不只模拟物理过程,还要生成感知。


03


DexImit:

机器人数据还能从哪里来?

刚才我们讲的是生成音频信号。

接下来,我们来看另一类与真实世界有关的交互信息:人和机器人怎样与真实世界中的物体发生交互。

这项工作的出发点很简单。我们关注Bimanual Dexterous Manipulation,也就是双手灵巧操作。它对于通用机器人非常重要,很多真实世界任务都需要两只手和灵巧操作,比如抓取、倒水、使用工具,以及长时序操作。


但真实机器人上的双手灵巧操作数据,采集起来既昂贵,又耗费人力。

与此同时,人类操作视频几乎是无限的。它们可以来自日常演示,也可以来自视频生成模型,而且这些视频本身就包含了人类操作物体的知识。

那我们能不能直接从人类视频中生成机器人的灵巧操作数据?

这就是我们提出DexImit的出发点。它的全称是Learning Bimanual Dexterous Manipulation from Monocular Human Videos。我们希望从人类视频出发,在仿真中生成模仿这些人类操作的机器人双手数据。


04


从一段人类视频,到真实机器人

具体怎么做?整个 pipeline 有四个阶段。


第一步是恢复人手和物体的运动。我们直接从一段单目人类视频开始,进行深度估计、手部姿态估计、3D 生成和物体的 6D pose estimation,最后把这些信息统一到 World Coordinate 中,得到手和物体随时间变化的 4D 交互轨迹。


但把轨迹恢复出来还不够。一段双手操作视频里,两只手可能同时在做不同的事情,一个长任务里也会连续出现多个动作。

所以第二步我们会把整个过程拆成不同的子任务,再安排两只手分别在什么时候执行什么动作。


接下来还有一个问题:人的手和机器人的手并不一样。

人的动作不能直接复制给机器人。我们需要根据前面恢复出来的交互,生成机器人真正能够执行的抓取姿态。这里我们会考虑 force closure 等物理约束,再通过 motion planning 生成平滑、无碰撞的机械臂轨迹,最终得到完整的仿真机器人示范。


得到这些数据之后,我们还会进行Augmentation。比如改变物体的位置和尺度、相机视角以及 observation,让训练出来的策略能够更好地泛化到真实世界。

数据质量同样很重要。我们还会利用视觉语言模型理解原始的人类操作视频,再检查生成出来的数据是否与原始操作一致。


那这些生成出来的数据到底能不能用?

我们主要想回答几个问题:生成的数据本身是不是有效?和已有方法相比,能不能得到更好的双手灵巧操作数据?面对更复杂、更长的任务还能不能工作?最后,能不能实现 zero-shot real-world deployment?

我们测试了不同来源和不同难度的人类视频。可以看到,人工采集的数据质量更好;随着任务变得越来越复杂,生成数据的准确性和可用性也会下降。


我们还和已有方法进行了比较。对于真实世界里更加复杂的任务,比如制作饮料、烹饪、切苹果和叠杯子,仅仅把视频中的动作恢复出来是不够的。尤其是long-horizon、fine-grained、contact-rich tasks,我们需要比较准确的 reconstruction,同时还要保证生成出来的动作交互在物理上是合理的。

比如切苹果,机器人不仅需要准确判断苹果的位置,还要控制切下去的力量,同时保证抓取足够稳定。



最后,我们进一步测试了 zero-shot real-world deployment。

为了让策略更好地泛化到真实环境,我们会对物体位置和尺度、相机视角以及 observation 做 augmentation。我们也做了 ablation study,分别改变其中一些设置。结果可以看到,完整方法的表现最好,这些 augmentation 对真实世界部署非常重要。


我们把 DexImit 生成的数据部署到了真实机器人上。

当然,DexImit 目前还有一些限制。

首先是柔性物体和关节物体。现在的 3D 生成阶段主要依赖 SAM 3D,它假设的是刚性物体几何,目前还不能很好地处理柔性物体或者带有关节结构的物体。未来可能需要更先进的 geometry reconstruction 或 generative modeling 来解决这个问题。

第二是移动操作。现在的方法主要面向桌面上的双手操作。如果机器人需要一边移动、一边操作物体,还需要进一步建模机器人本体的运动和环境动态。

第三是长视频。整个 pipeline 由多个模块连续执行,误差可能会随着时间不断累积。视频越长,这个问题越明显。有些情况下还是需要人工介入,比如调整基于 VLM 的子任务分解,或者修正重建过程中出现的问题。

最后是手内操作,比如在手里旋转一个橙子。这类任务中,手和物体之间会产生非常严重的遮挡,单目视频能够提供的信息有限,目前 DexImit 也没有专门针对这种情况设计机制。


我们的代码已经开源,大家感兴趣的话也可以进一步尝试。

05


Q&A 现场问答

Q1(现场观众):有没有哪些特定的噪声或声音,会对机器人策略产生负面影响?或者有些声音对人类有用,但机器人却无法利用?

李柏依:这是一个很好的问题,我们也一直在思考。比较有意思的是,我们在训练时其实没有做任何噪声增强(noise augmentation),但模型在有背景噪声的情况下依然比较鲁棒。我们猜测,可能是因为音频本身是一维信号,不同声音之间比较容易区分。比如模型训练过倒水的声音之后,即使环境中同时出现其他声音,也可以把不同的声音区分开。当然,这只是我们目前的推测。

Q2(现场观众):有没有一些任务,即使加入声音,对机器人也没有什么帮助?

李柏依:这个我们还没有测试。但很容易想到声音在哪些任务里发挥作用。比如当视觉信息受到干扰的时候,声音就很重要。对于其他任务,比如拿起一个杯子或者拿起手机,声音可能就没有那么重要。通常我们并不需要依靠声音去抓取手机或者杯子。

为了方便大家抱团交流、互通会议消息,我们专门建了ECCV 2026参会交流群!进群你会解锁这些「福利」

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

进群传送门:扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向。

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
西足协官方:赫伊森、皇马助教、马竞门将教练各被停赛一场

西足协官方:赫伊森、皇马助教、马竞门将教练各被停赛一场

懂球帝
2026-09-23 19:59:18
远嫁巴基斯坦的广西女教师易菲自曝近况:无收入、无自由、如今被婆家殴打

远嫁巴基斯坦的广西女教师易菲自曝近况:无收入、无自由、如今被婆家殴打

小徐讲八卦
2026-09-21 09:39:54
28岁金建宇意外去世!家属发布讣告:与林孝埈是好友 6月份刚退役

28岁金建宇意外去世!家属发布讣告:与林孝埈是好友 6月份刚退役

风过乡
2026-09-23 07:57:34
全线溃败!俄军弃守利曼北部突出部,大面积阵地彻底拱手让人

全线溃败!俄军弃守利曼北部突出部,大面积阵地彻底拱手让人

老马拉车莫少装
2026-09-08 22:48:14
我逼女儿嫁本地她偷嫁新疆,七年后她挺着七月肚跪我床前

我逼女儿嫁本地她偷嫁新疆,七年后她挺着七月肚跪我床前

真实人物采访
2026-09-23 16:00:10
扮猪吃虎?隐忍四个月,委代总统撕下面具,率几十万大军硬刚美国

扮猪吃虎?隐忍四个月,委代总统撕下面具,率几十万大军硬刚美国

好贤观史记
2026-04-23 16:53:57
错换人生再起波澜!郭希宽墓碑刻“长子郭威、次子姚策”,杜新枝证实:全系郭威安排

错换人生再起波澜!郭希宽墓碑刻“长子郭威、次子姚策”,杜新枝证实:全系郭威安排

老猫观点
2026-09-23 07:05:55
楼市重磅!湖北出台“20条”新政支持楼市发展!

楼市重磅!湖北出台“20条”新政支持楼市发展!

襄阳楼市
2026-09-23 16:40:18
“尼特族” 已达 2.6 亿?比啃老还令人唾弃,离开父母他们该怎么活

“尼特族” 已达 2.6 亿?比啃老还令人唾弃,离开父母他们该怎么活

离离言几许
2026-08-23 16:56:32
四年级男孩周末独自在家上吊身亡,父母索赔70万被法院驳回:这次,网友吵翻了

四年级男孩周末独自在家上吊身亡,父母索赔70万被法院驳回:这次,网友吵翻了

教师吧
2026-09-07 17:17:34
智商高过爱因斯坦!13岁小孩哥即将读研?然而小时候被当成弱智,差点埋没...

智商高过爱因斯坦!13岁小孩哥即将读研?然而小时候被当成弱智,差点埋没...

英国那些事儿
2026-09-23 00:55:48
马斯克再次力荐中国:“只要时间允许就一定要去中国看看,中国值得一看的东西太多”

马斯克再次力荐中国:“只要时间允许就一定要去中国看看,中国值得一看的东西太多”

环球网资讯
2026-09-23 07:58:24
中央批准:王陆进任河南省委副书记,河南省委决定:王陆进任河南省政府党组书记

中央批准:王陆进任河南省委副书记,河南省委决定:王陆进任河南省政府党组书记

政知新媒体
2026-09-23 12:56:05
里子面子全丢了!谢广坤翻车仅1天,更多猛料被扒,赵本山被牵连

里子面子全丢了!谢广坤翻车仅1天,更多猛料被扒,赵本山被牵连

王投吃吃喝喝
2026-09-23 13:06:48
中方访美前夕,第一夫人梅拉尼娅的一封信,道出特朗普的真实处境

中方访美前夕,第一夫人梅拉尼娅的一封信,道出特朗普的真实处境

共工之锚
2026-09-23 00:29:39
2026年9月成都大变天!老砂舞彻底洗白,老辈子夜落脚点彻底没了

2026年9月成都大变天!老砂舞彻底洗白,老辈子夜落脚点彻底没了

成都人的故事
2026-09-23 23:25:03
3换1交易!老鹰送出希尔德+内姆哈德+现金 从黄蜂换来芬尼史密斯

3换1交易!老鹰送出希尔德+内姆哈德+现金 从黄蜂换来芬尼史密斯

罗说NBA
2026-09-23 06:05:52
男女4x100混合接力夺冠,徐嘉余15金加冕中国亚运第一人

男女4x100混合接力夺冠,徐嘉余15金加冕中国亚运第一人

懂球帝
2026-09-23 23:30:06
焦元南:一九九八·香坊局(5/8)

焦元南:一九九八·香坊局(5/8)

金昔
2026-09-22 21:01:42
中国富豪最多的城市不在北京、不在上海,而在这里…

中国富豪最多的城市不在北京、不在上海,而在这里…

慧翔百科
2026-09-23 08:37:26
2026-09-24 03:36:49
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7669文章数 20785关注度
往期回顾 全部

科技要闻

网易未来大会圆满落幕 硅基智能跨越临界点

头条要闻

肺癌女性中98%从不吸烟 钟南山团队回应

头条要闻

肺癌女性中98%从不吸烟 钟南山团队回应

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

电池的权力游戏

汽车要闻

宾利首款纯电SUV 托卡尔正式发布 国内售价198.8万起

态度原创

时尚
手机
本地
亲子
旅游

专场|| 最近最爱的一件羊绒薄针织,一周穿5天买得好值!

手机要闻

小米18Pro发布!全球首发第六代骁龙8至尊版

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

亲子要闻

24岁女子花12万元“定制”龙凤胎,产检显示只有一个胎儿,给她安排手术的“健康咨询公司”:打掉,再试一次

旅游要闻

上海金山最后活着的老街,免费逛,比陆家嘴更值得去

无障碍浏览 进入关怀版