网易首页 > 网易号 > 正文 申请入驻

主动理解物理世界:ROMA让机器人学会交互探索物体

0
分享至



我见,我摸,我理解。

人类认识一个物体,从来不只是「看」。看到一个盒子,我们可能会拿起来掂一掂,判断它有多重;我们可能会摇一摇,听听里面有没有东西;还可能会捏一捏,试试它软不软。人类感知世界的过程不是被动地接受已有的感官信息,而是在发现我们对身边事物不够了解时,主动地与之交互,根据交互的信息补全对世界的物理理解。

来自人大高瓴GeWu-Lab、智源研究院、燧行 AresoX 等机构的研究者所提出的ROMA (Real-World Object-Centric Multi-Sensory Active Perception),正是希望将这种主动感知物理世界的能力赋予多传感器机器人。该工作全面地从数据集与 Benchmark、多模态推理模型和物理交互系统展开对具身多模态主动感知的系统研究,希望为下一代主动具身 Agent铺平道路。



图 1 | 真实世界多模态主动感知系统 ROMA

  • 论文标题:ROMA: LLM System for Real-World Object-Centric Multi-Sensory Active Perception
  • 论文地址:https://arxiv.org/abs/2610.06955
  • 项目主页:https://gewu-lab.github.io/ROMA/
  • 数据集与模型:https://huggingface.co/datasets/GeWuLab/ROMA
  • 开源代码:https://github.com/GeWu-Lab/ROMA

如果当前的信息不足以完成任务,

机器人应该怎么办?

想象这样一个场景:人类和机器人说「帮我找个杯子装点茶」。机器人需要首先明白人类的意图是想找一个空的杯子,然后从各种可能的候选物体中,找到这一空杯子。它可能需要通过摇一摇、掂一掂,才能判断哪个杯子是空的。这一稀松平常的场景反映了一个关键的具身研究问题:机器人不仅需要理解人类指令中隐含的意图,还需要知道完成当前任务还缺少什么信息,这些信息需要通过什么方式、哪些感知模态来主动地获取。

ROMA 正是围绕这一关键问题,给出了一套从数据集和Benchmark,到推理模型和物理系统的完整方案。它将视听触力四大常用模态的感知整合到ROMA-7B模型中,并教会机器人判断自己缺什么信息,确定和哪个物体交互、怎么交互、关注什么模态、是不是已经足以完成任务了,并顺利地执行这些交互来获得多模态反馈,形成一个完整的推理-交互-反馈循环。

ROMI-2K:近 2000 个真实物体,

多感官交互数据

要让机器人学会主动地交互与探索,一个核心的挑战在于:机器人需要理解不同的物理交互会带来什么信息。为此,研究团队构建了一个大规模真实世界多模态物体交互数据集ROMI-2K,覆盖近 2000 个日常物体与内含物组合,并围绕 6 种基础物理交互(举起、按压、碰撞、捏紧、摇晃和旋转),进行手持设备和真实桌面机械臂场景的数据采集。每次与物体的交互同步采集视觉、听觉、触觉和力四种模态的观测信息,同时对物体材质、硬度、粗糙度、纹理、内容物等物理属性进行详细的标注。在此基础上,研究团队进一步构建了场景级多模态主动感知问答数据,让模型学习根据当前任务选择合适的交互行为与感知模态,以获取缺失的关键证据。



图 2 | 真实世界多模态物体交互数据集 ROMI-2K

ROMA Bench:从交互到「感知链」

在主动感知过程中,一次交互获得的模态观测,会影响下一次交互的选择。例如,通过摇晃判断物体是否为空时,如果物体发出了明显的内含物声音,便不再需要交互。而没有发出声音时,也不能排除是内含物将物体内部填满了,需要再掂一掂重量来确认。这就形成了一条由推理-交互-反馈不断串联起来的感知链。基于感知链这一重要概念,研究团队在 ROMI-2K 的真实桌面子集上进一步构建了ROMA Bench,包含2,100 个场景级主动感知任务,覆盖:(1)Single-Chain:单属性推理;(2)Multi-Chain:多属性、长链推理;(3)Intent-Driven:根据用户隐含意图确定需要获取的属性并推理。任务涉及硬度、粗糙度、纹理、内容物、材质和重量等多种物理属性。这使得主动感知脱离「做一次交互然后回答问题」的简单范式,而是形成一个需要完整的目标选择、动作选择、模态选择和连续推理的过程。



图 3 | ROMA Bench 多模态主动感知任务示例

ROMA 系统:物理接口与会主动决定交互的 ROMA-7B

ROMA Bench 为考察驱动机器人的模型是否「知道该怎么探索」提供了可能,而 ROMA 系统则进一步让这种能力真正地进入物理世界。研究团队搭建了一套真实世界多模态物理交互系统,将视觉、听觉、触觉和力四种感知模态与机械臂连接,并设计统一的物理交互接口,使模型能够直接输出真实物体的交互指令。

具体而言,ROMA 将抓取和 ROMI-2K 中的六大基础交互动作程序化,并基于 AnyGrasp 抓取策略,搭配精心设计的点云补全、抓取筛选和增强机制,提升真实世界中的稳定抓取能力,将交互决策可靠地转化为真实世界中的物理动作。

在此基础上,研究团队基于 Qwen 2.5-Omni,通过多传感器联合对齐和主动感知场景微调训练了 ROMA-7B 主动感知模型。它能够结合当前任务目标和已有的观测信息,主动地决定抓取哪个物体、执行什么交互、需要哪些模态的信息,以及该何时停止探索,并根据每次交互获得的新数据动态地调整后续的交互,形成「推理-交互-反馈-再推理」的闭环,让机器人能够主动地通过与世界交互,不断完善对物理世界的理解。



图 4 | ROMA 真实世界主动多模态物体感知系统示意图

多模态主动感知能力整体打平 GPT-6 Astra,领先多款前沿大模型

在多模态主动感知 ROMA Bench 的 2100 道多选题、判断题和排序题上,ROMA-7B取得 72.9%的总体任务成功率,整体表现基本与最新的GPT-6 Astra持平,并明显优于GPT-5.4和Gemini 3.5 Flash。GPT-6 Astra 凭借更强的视觉理解与通用推理能力,在单步、视觉可推断属性上表现突出;而 ROMA-7B 则在需要连续交互、综合多种模态反馈,尤其是音频的 Multi-Chain 任务中展现出更强的优势,明显超过 GPT-6 Astra。

相比之下,参数规模相近的未经过 ROMI-2K 微调的Qwen 2.5-Omni和Qwen 3-Omni在面对 ROMA Bench 所要求的目标选择、交互指令遵循和多模态主动推理时表现明显不足。这也体现了ROMI-2K 数据集的核心价值:通过大规模真实物体交互时的同步视觉、音频、触觉和力数据,为学习多模态主动感知能力提供了关键的训练基础,使 ROMA-7B 能够以仅 7B 的模型规模获得接近 GPT-6 Astra 的多模态主动感知能力,并超越其他前沿闭源模型。



表 1 | ROMA Bench 多模态主动感知测评结果

在真实世界实验中的 8 个多物体场景、132 道开放问答题上,ROMA-7B 仍取得 61.4%的总体成功率,接近于 GPT-6 Astra 并仍然大幅领先其他前沿大模型,证明通过 ROMI-2K 学习到的主动感知能力能够在真实世界的场景中保持,而不是仅仅局限于基准测试中的固定任务形式。



表 2 | 真实世界多模态主动感知测评结果



图 5 | Single-Chain 任务完成演示(ROMA全自动,2.5倍速)



图 6 | Multi-Chain 任务完成演示(ROMA全自动,2.5倍速)



图 7 | Intent-Driven 任务完成演示(ROMA 全自动,2.5倍速)

从 ROMA 出发,

迈向更主动的多模态具身智能

ROMA 目前主要围绕 6 种基础物理交互展开研究,但这只是一个起点。作为一个基础性的系统工作,ROMA 未来可以进一步启发并探索:更丰富的交互 Skill、主动感知与操纵策略的统一、多轮对话与长时序推理、跨场景的持久物体记忆、面向不同机器人形态的主动感知等。正如开篇所说:我见,我摸,我理解。ROMA 希望让机器人也能主动与世界交互,并通过一次次的探索真正理解世界。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
体长可超2米!云南永德大雪山保护区首次记录到这种大鱼

体长可超2米!云南永德大雪山保护区首次记录到这种大鱼

昆明信息港
2026-10-09 15:24:37
空姐下跪失控!药企大佬被逼报警,网友向东航施压,静待完整真相

空姐下跪失控!药企大佬被逼报警,网友向东航施压,静待完整真相

瑛派儿老黄
2026-10-10 02:02:38
敢在深圳挑战华润置地,这家民营房企彻底火了

敢在深圳挑战华润置地,这家民营房企彻底火了

地产一品塘
2026-10-10 00:33:01
高水平外资,在打骨折卖商业大楼

高水平外资,在打骨折卖商业大楼

老凤说财经
2026-08-03 11:17:22
记者:拉塞尔传球确实NBA全明星级别 进攻完全不用担心

记者:拉塞尔传球确实NBA全明星级别 进攻完全不用担心

狼叔评论
2026-10-09 23:16:06
4天被卖3次!演员王星案纪录片首曝全过程,诈骗集团一句话让人脊背发凉:妙瓦底最缺的是人,不是钱

4天被卖3次!演员王星案纪录片首曝全过程,诈骗集团一句话让人脊背发凉:妙瓦底最缺的是人,不是钱

秋风妃
2026-10-08 00:06:49
别等失去了才后悔。 厦门小伙暗恋高一班主任多年,大学毕业后果断追娶回家,祝有情人终成眷属

别等失去了才后悔。 厦门小伙暗恋高一班主任多年,大学毕业后果断追娶回家,祝有情人终成眷属

捣蛋窝
2026-10-03 09:50:51
北京市政府副秘书长丁章春,拟履新!娄底市监察委员会委员刘志升,拟任新职!

北京市政府副秘书长丁章春,拟履新!娄底市监察委员会委员刘志升,拟任新职!

阿天爱旅行
2026-10-10 11:34:04
深夜6股发业绩,中国巨石增100%,4股大幅增2股暴雷,别踩雷

深夜6股发业绩,中国巨石增100%,4股大幅增2股暴雷,别踩雷

风风顺
2026-10-10 04:25:10
大胜!火箭135-117独行侠,球员评分:3人满分,3人及格,2人低迷

大胜!火箭135-117独行侠,球员评分:3人满分,3人及格,2人低迷

阿嚼影视评论
2026-10-09 23:11:57
局势彻底变天了!中日对峙一天天拖下去,越来越多国家终于意识到:中日若兵戎相见,不会像俄乌冲突那样给第三方牟利的机会,而是一场血战

局势彻底变天了!中日对峙一天天拖下去,越来越多国家终于意识到:中日若兵戎相见,不会像俄乌冲突那样给第三方牟利的机会,而是一场血战

林杰论事
2026-10-03 02:28:50
中国葛洲坝集团电力有限责任公司违规被罚

中国葛洲坝集团电力有限责任公司违规被罚

齐鲁壹点
2026-10-10 11:38:40
重庆帅哥东东离世,年仅31岁!临终前2天狂吃冰,死因曝光太可惜

重庆帅哥东东离世,年仅31岁!临终前2天狂吃冰,死因曝光太可惜

嫹笔牂牂
2026-10-10 07:10:23
男子炮轰中国部分媒体!拿中国长处贬低他国短处,中国不是天堂,外国也不是地狱

男子炮轰中国部分媒体!拿中国长处贬低他国短处,中国不是天堂,外国也不是地狱

小徐讲八卦
2026-09-13 07:40:07
县长下乡暗访,遭到几名干部和警察打骂,没想到县长早就做好准备

县长下乡暗访,遭到几名干部和警察打骂,没想到县长早就做好准备

牛魔王与芭蕉扇
2025-03-13 10:44:30
为啥没观看梅西告别战?劳塔罗妻子:怕耽误孩子上学提前走了

为啥没观看梅西告别战?劳塔罗妻子:怕耽误孩子上学提前走了

懂球帝
2026-10-09 23:30:09
豪赌!曼联砸 8000 万抢 33 岁超巨!名宿直言金球热门必须拿下

豪赌!曼联砸 8000 万抢 33 岁超巨!名宿直言金球热门必须拿下

奶盖熊本熊
2026-10-10 08:01:56
广东男篮为什么打不过山东队?广东主帅一席话,直接戳中要害

广东男篮为什么打不过山东队?广东主帅一席话,直接戳中要害

阿嚼影视评论
2026-10-10 06:35:27
7万暴跌到2万8!深圳光明彻底熄火,当年抢破头的中产亏惨了

7万暴跌到2万8!深圳光明彻底熄火,当年抢破头的中产亏惨了

爱看剧的阿峰
2026-10-09 11:04:55
WTT大满贯爆冷!女双主力出局,曼昱组合打疯,张本美和再遇克星

WTT大满贯爆冷!女双主力出局,曼昱组合打疯,张本美和再遇克星

漫川舟船
2026-10-10 10:47:03
2026-10-10 12:31:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14167文章数 142748关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

牛弹琴:诺奖没颁给特朗普当事人很生气 严重后果来了

头条要闻

牛弹琴:诺奖没颁给特朗普当事人很生气 严重后果来了

体育要闻

与C罗硬碰硬,一个72岁老人的倔强

娱乐要闻

王仁君获飞天视帝,赵丽颖发文祝贺

财经要闻

蹭尊界流量?岚图汽车在“玩火”

汽车要闻

2027款深蓝L06及追风版上市 限时权益价11.49万元起

态度原创

亲子
旅游
数码
游戏
手机

亲子要闻

给你家孩子透个底十月份有两件好事

旅游要闻

杭州:千岛湖隧道艺术馆焕发文旅新活力

数码要闻

技嘉猎鹰白金系列电源,高性能整机稳定之选

《英雄联盟》EMEA Masters据称临时换版,教练称备战仓促

手机要闻

一加16配置面面俱到 还有凡人修仙传联名礼盒

无障碍浏览 进入关怀版