网易首页 > 网易号 > 正文 申请入驻

看懂不等于做对:VA-Bench测出大模型空间智能的执行断层

0
分享至



大模型已经越来越会「看懂」空间:它能判断物体在机械臂哪一侧,也能识别该操作哪个目标、理解任务怎么做。但如果真的把机械臂交给它,问题会变得更具体:该移动多少毫米?当前视角够不够?抓空以后,又该怎么调整?

VA-Bench 测试了 12 个主要多模态模型。表现最好的几组模型,在目标识别与定位(TL)上达到100%,操作语义理解(MS)也达到99.6%—100%;但完整任务成功率只有约一半:Qwen3.8-max、Opus-5 和 GPT-5.6-sol 分别为53.93%、52.86%和 51.55%。

目标找对了,任务也看懂了,为什么真正动起来以后,还是只有大约一半能成功?对于这些情况来说,模型真的「理解」了空间吗?

这正是 VA-Bench 想测的问题。



  • 论文标题: VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control
  • 论文链接:https://arxiv.org/pdf/2609.19554
  • 项目主页:https://github.com/zhangzhongbo2213/VABench
  • Huggingface paper: https://huggingface.co/papers/2609.19554

空间智能,不能只停在「答对」

很多空间推理 Benchmark 已经能评估深度、距离、三维关系和多视角理解,但通常由评测者提前决定「模型看什么、回答什么」。真正进入机器人环境后,模型还要自己判断当前信息是否足够;如果不够,就决定缺什么、该从哪里继续观察。新的视觉证据补齐后,再把空间判断落到具体动作,并根据执行结果决定是否修正。

因此,真正面向物理行动的空间智能,不应该止步于回答一个已经定义好的空间问题。围绕这一点,我们提出了VA-Bench(Vision-Action Benchmark),把空间智能放进一个完整的闭环:

Observe → Reason → Act → Revise,即「观察 → 推理 → 行动 → 修正」。



图 1:VA-Bench 与传统空间评测的对比。

VA-Bench 要求模型真正进入机器人与环境的交互过程。测试前,模型观看成功示范视频,理解任务怎么做,但不会获得物体坐标、专家轨迹或精确动作参数;测试中,它可以主动切换视角,但会消耗交互步数,必须在继续观察和开始行动之间做出取舍。

最后,空间判断还必须真正落到动作上。模型需要直接给出具体的移动距离和旋转角度,并决定什么时候打开或闭合夹爪。



图 2:主动观察与执行过程示例。

14 类任务,280 个基础场景

VA-Bench 包含14 类机器人操作任务,其中有11 类单臂任务和 3 类双臂任务,每类 20 个经过物理验证的场景,共 280 个基础场景。

此外还设置了几何迁移和长时序组合测试,进一步追问:换一个空间布局,模型还能重新判断怎么做吗?会做若干独立操作,又是否意味着能够把它们稳定地串成更长的任务?



表 1:VA-Bench 基础任务设置。

目标找对了,为什么还是做不对

从整体结果看,表现最好的几组模型完整任务成功率只有约一半,但子任务完成率达到65.9%—68.6%。这说明很多失败并不是模型完全不知道怎么做,而是已经完成了其中不少步骤,却没能把整个任务稳定做完。

进一步拆解模型的执行过程,当前的困难主要集中在三个环节:从目标识别到精细空间执行、从错误发现到在线修正,以及从单臂操作到双臂协同。



图 3:VA-Bench 的主要实验结果。

找到目标,不等于能精确移动到目标。

前三的模型在目标识别与定位(TL)上全部达到100%,在操作语义理解(MS)上也达到99.6%—100%。但到了更精细的空间执行阶段,例如接触前的细粒度分析(FG)、与目标之间的空间关系判断(SR)等,成绩开始明显下降。

一个模型完全可能准确找到一个瓶子,却在夹爪还没有下降到合适高度时提前闭合;也可能理解「需要把物体放进容器」,却无法稳定判断物体与容器之间精确的高度、深度和接触位置。

会发现错误,也不等于能及时改回来。

Qwen3.8-max、GPT-5.6-sol 和 Opus-5 在错误发现(ED)上的得分分别达到73.6%、70.8%和 69.9%,但到了真正的在线修正(OC),三者分别只有46.7%、27.3%和 32.4%。模型已经越来越能发现「哪里不对」,但还不擅长把新的观察迅速转化成有效修正。

一只机械臂已经不容易,两只更难。

当任务从单臂进一步进入双臂协同时,这种困难又被进一步放大。Qwen3.8-max 在单臂任务上的平均成功率达到65.61%,但双臂任务只有11.11%;Opus-5 从64.09%降至 11.67%。



表 2:单臂、双臂及整体任务成功率。

这类任务的难点并不只是「多控制一只机械臂」。模型还需要判断哪只机械臂负责哪个物体、两只机械臂之间应该保持怎样的相对位置,以及不同动作应该按什么顺序衔接。任何一个环节的空间判断出现偏差,都可能让后续动作无法继续。

多给几个视角,就能解决问题吗

如果直接把更多视角一次性提供给模型,是不是就不需要主动观察了?为此,VA-Bench 设置了一组对照实验:一种情况下,模型每次只看到当前视角,但可以根据当前任务需要主动切换观察方向;另一种情况下,模型直接获得5 个固定视角,但不能继续自主选择新的观察位置。



表 3:主动观察与固定五个视角的结果对比。

结果非常一致:4 个模型在失去主动观察能力以后,成功率全部下降。

主动观察真正重要的地方,可能并不是让模型单纯地「多看」,而是让它知道自己还缺什么,以及下一眼应该去哪里找答案。

换个布局、拉长任务,能力还剩多少

几何迁移测试保持任务目标和操作流程不变,只改变物体形状、容器或空间布局。Qwen3.8-max 的成功率从77.86%降至 67.86%,GPT-5.6-sol 则从80.00%降至 47.86%。

模型知道一种操作怎么完成,并不意味着进入新的空间布局后,还能重新建立正确的空间关系。



表 4:几何迁移与长时序组合测试结果。

类似的问题在更长的执行过程中被进一步放大。VA-Bench 设置了一个五个物体的长时序组合任务,Qwen3.8-max 最终完成了61/100 次物体放置,GPT-5.6-sol 完成了53/100 次。

有的模型能够完成不少中间步骤,但整个任务却没有任何模型完整完成过一次。会做几个独立操作,不代表模型就能在长任务中持续稳定执行。

从「看懂」走向真正的空间智能

VA-Bench 看到的不是简单的「会」或「不会」,而是一系列更具体的能力边界:模型可以找到目标,却未必能精确移动到目标;可以发现错误,却未必能及时修正;可以获得更多画面,却未必知道当前最需要看哪里;可以完成几个独立步骤,却未必能稳定完成更长的任务。

今天的多模态大模型已经越来越会「看懂」物理世界,但从理解到可靠行动之间,仍然存在明显距离。

VA-Bench 想做的,就是把这段距离测出来。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中央气象台:今晚到明晚,海南岛、新疆、内蒙古、黑龙江、甘肃、四川、贵州、云南、台湾岛等地有小到中雨,海南岛中东部有暴雨或大暴雨

中央气象台:今晚到明晚,海南岛、新疆、内蒙古、黑龙江、甘肃、四川、贵州、云南、台湾岛等地有小到中雨,海南岛中东部有暴雨或大暴雨

蓬勃新闻
2026-10-07 17:54:32
国庆高速数据彻底打脸!油电大势已定,再也回不去了

国庆高速数据彻底打脸!油电大势已定,再也回不去了

华庭讲美食
2026-10-06 02:59:29
热苏斯:我读了C罗的声明,现在我要和往常一样去足协工作

热苏斯:我读了C罗的声明,现在我要和往常一样去足协工作

懂球帝
2026-10-07 17:37:19
张之臻上海大师赛1-2遭马哈奇逆转止步首轮,周杰伦昆凌、许昕姚彦夫妇到现场观赛

张之臻上海大师赛1-2遭马哈奇逆转止步首轮,周杰伦昆凌、许昕姚彦夫妇到现场观赛

大风新闻
2026-10-07 18:58:08
染红后微笑离场!前国脚怒批韦世豪:不顾集体利益 惯犯 永远改不了

染红后微笑离场!前国脚怒批韦世豪:不顾集体利益 惯犯 永远改不了

风过乡
2026-10-07 08:23:48
俄罗斯鼠疫信息被指不透明,免签国人员要小心了,鼠疫属于甲类传染病,新冠还是乙类传染病,比新冠要严重很多,肺鼠疫未治疗死亡100%

俄罗斯鼠疫信息被指不透明,免签国人员要小心了,鼠疫属于甲类传染病,新冠还是乙类传染病,比新冠要严重很多,肺鼠疫未治疗死亡100%

村里的月光
2026-10-07 15:16:19
俄媒:俄鼠疫感染区医院暴发瘟疫,出现第二例死亡病例

俄媒:俄鼠疫感染区医院暴发瘟疫,出现第二例死亡病例

阿尔卑斯瞭望
2026-10-07 14:05:52
被记者拦车采访,葡萄牙主帅热苏斯回应C罗长文声明:我没什么可说的;葡媒:热苏斯团队已提前知晓C罗声明,且认为内容可以接受

被记者拦车采访,葡萄牙主帅热苏斯回应C罗长文声明:我没什么可说的;葡媒:热苏斯团队已提前知晓C罗声明,且认为内容可以接受

大风新闻
2026-10-07 14:06:14
据说,每天有3万人退场

据说,每天有3万人退场

一条要飞跃的咸鱼
2026-10-07 08:49:43
大结局!东航“最霸气”乘客欧某某,这次终于踢到铁板了,真容曝光,全网社死

大结局!东航“最霸气”乘客欧某某,这次终于踢到铁板了,真容曝光,全网社死

静若梨花
2026-10-06 14:15:09
闹大了!网红解密川剧变脸账号消失,变脸是国家二级机密?网友:封号或另有原因

闹大了!网红解密川剧变脸账号消失,变脸是国家二级机密?网友:封号或另有原因

火山詩话
2026-10-07 07:44:10
诺贝尔化学奖揭晓,两位化学家共同获奖

诺贝尔化学奖揭晓,两位化学家共同获奖

澎湃新闻
2026-10-07 18:14:07
全程堵死!10月6日返程大崩溃,高速寸步难行,网友:堵到绝望

全程堵死!10月6日返程大崩溃,高速寸步难行,网友:堵到绝望

杰丝聊古今
2026-10-07 12:36:54
“根本不想让他们来!”亚运会结束后,组委会主席言论引发争议

“根本不想让他们来!”亚运会结束后,组委会主席言论引发争议

全景体育V
2026-10-07 08:24:04
祁连县把泼天的流量接成了脏水

祁连县把泼天的流量接成了脏水

陈宜之
2026-10-07 16:26:38
独自飞往仰光后杳无音信,26岁白俄模特被网上兼职诱骗至缅甸杀害,5名招募者因人口拐卖获刑21年

独自飞往仰光后杳无音信,26岁白俄模特被网上兼职诱骗至缅甸杀害,5名招募者因人口拐卖获刑21年

扬子晚报
2026-10-06 20:24:16
吴奇隆因举旗被取消活动,网友质疑其立场,吴奇隆:不赚钱也这样

吴奇隆因举旗被取消活动,网友质疑其立场,吴奇隆:不赚钱也这样

蜜桔娱乐
2026-10-07 09:55:52
地雷风波升级,金与正发声:野兽都不能进进出出

地雷风波升级,金与正发声:野兽都不能进进出出

中国新闻周刊
2026-10-07 16:43:44
很严峻!这5个行业,工资都发不下来了!

很严峻!这5个行业,工资都发不下来了!

职场资深秘书
2026-10-07 17:36:30
中国民航进入萎缩期?国庆旅游火爆,民航客流却连跌3天,机票低至200元

中国民航进入萎缩期?国庆旅游火爆,民航客流却连跌3天,机票低至200元

三言四拍
2026-10-06 20:43:40
2026-10-07 20:00:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14143文章数 142744关注度
往期回顾 全部

科技要闻

诺贝尔化学奖揭晓,两位科学家摘得大奖

头条要闻

男子带妻子和10岁娃爬山走野路 用手机照亮半夜没走出

头条要闻

男子带妻子和10岁娃爬山走野路 用手机照亮半夜没走出

体育要闻

从骑马舞到开口全中文 德约在北京不止七冠

娱乐要闻

蔡康永风波再升级!这次谁也救不了他

财经要闻

谷歌签下科技史上最大核能协议

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

艺术
旅游
家居
亲子
军事航空

艺术要闻

吴冠中 84岁画的风筝,358.4万港元!

旅游要闻

【图集】甲秀楼游人如织 文明相伴景更美

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

宝蓝和叔叔玩过家家扮演大人,叔叔藏起来吃零食不让宝蓝找到

军事要闻

外舰跟监遵义舰 结果自己先"趴窝"了

无障碍浏览 进入关怀版