网易首页 > 网易号 > 正文 申请入驻

从 Computer-Use 到 Robot-Use:一套接口让 VLM 直接「玩转」真实机器人

0
分享至





  • 标题:Show-Harness: Just a VLM Agent Can Play Robots
  • 作者:Yanzhe Chen*, Zechen Bai*, Zhijun Cao*, Wenzheng Zeng*, Kevin Qinghong Lin, Yiqi Lin, Guoqiang Liang, Kevin Yuchen Ma, Qiming Huang, Mike Zheng Shou†
  • 单位:新加坡国立大学 Showlab
  • 项目主页:https://showlab.github.io/Show-Harness/
  • 论文链接:https://arxiv.org/abs/2609.10522
  • 开源代码:https://github.com/showlab/Show-Harness
  • 开源模型:https://huggingface.co/showlab/Show-Harness-VLMs
  • 开源数据:https://huggingface.co/datasets/showlab/Show-Harness-Data



视频链接:https://mp.weixin.qq.com/s/-zIsqpz7IRX4OBDf7nbexA

今天的 Agent 已经能看懂屏幕、理解任务,并通过 click、type、scroll 等鼠标键盘操作来完成数字世界的任务,那么它距离操控真实世界里的机器人,还差什么?

过去一段时间,越来越多工作开始尝试让 GPT、Claude、Gemini 等 frontier models 参与真实机器人控制。这背后有一个很直接的判断:当我们讨论具身智能时,常常强调 “具身”,但核心仍然是 “智能”。而今天最强的智能,包括视觉理解、空间推理和任务分解等能力,都逐渐集中到 frontier foundation models 中。

问题在于,这些能力并不会自然的变成机器人动作。过去的研究尝试了不同的路线去利用 foundation model。传统的 VLA 往往让模型基于图像和任务指令直接回归连续控制量;另一类系统则让大模型只负责规划,再由独立的控制器完成物理执行。前者需要为不同机器人和数据分布反复适配,后者又拉开了语义决策与实际动作之间的距离。

新加坡国立大学 Show Lab 的研究者提出Show-Harness。这个工作的出发点不是再训练一个更大的机器人策略,而是追问:如果给 foundation model 一个它能够理解、组合并持续校正的物理接口,它已有的智能能否更直接地进入物理世界?



图 1:Show-Harness 在不同任务、环境、机器人形态和模型上的真实机器人演示

Robot-Use 也需要接口

Computer-Use 相关的研究给出了一个很直观的参照。在电脑上,Agent 并不需要输出底层驱动信号;它面对的是 click、type、scroll 等清晰、可组合、能从观察中验证结果的动作接口。模型据此形成 observe → reason → act 的闭环。

机器人控制也可以从类似的视角重新理解。真正难的并不只是 “让模型决定一个动作”,而是设计一层接口:它既要让 VLM 能够把视觉和空间理解映射到行动意图,又要足够细粒度,能在真实世界中完成接近、对齐、抓取、放置和修正。

Show-Harness 作为专门为具身智能设计的Embodied Harness,其核心就是这样一套介于模型和机器人控制之间的语义动作接口:对于模型而言,动作是可读、可推理的语义单元;对于机器人而言,动作会由各自的解释器转成受安全边界约束的本地控制命令。



图 2:Show-Harness 概览。不同 VLM 通过同一语义接口与不同机器人形态连接

不让 VLM 去 “猜” 连续控制量,

而是让它持续做细粒度决策

Show-Harness 的动作空间包含一组紧凑的语义动作单元。例如,模型可以选择相对于当前参考视角的前后、左右、上下移动,也可以做绕特定轴的旋转、抓取、释放或结束任务。

这种表示有两个关键点:

  • 语义上可理解。模型不必直接输出关节或末端位姿数值,而是围绕 “目标在什么方向”“下一步应靠近还是下移”“是否已经对齐” 来决策。这种更明确的语义表达更容易被模型所理解,并在其上进行推理。
  • 物理上可落地。每一个语义单元都对应一个小而有界的物理变化。不同机器人通过各自的动作解释器,把相同的动作意图映射为各自的运动控制目标。

因此,模型侧接口不随机器人形态改变;改变具身平台时,系统替换的是底层动作解释器,而不是要求 VLM 重新学习一套面向关节和坐标系的动作语言。对零样本 frontier agent 而言,论文中的跨具身本体的切换仅通过更换机器人底层控制解释器完成。

更重要的是,这不是一次性输出长计划再 “盲执行”。Harness 将多视角图像、机器人本体状态、短期动作历史和任务描述组织进循环:模型观察当前状态、分解或更新子任务、做出语义动作,执行后再根据新的视觉与状态反馈继续修正。



图 3:Show-Harness 的 perceive–reason–act 闭环。感知、推理与执行模块围绕共享语义接口组织。

GUMI:一套 GUI,同时服务人类和 Computer-Use Agent

如果语义动作本身可读、可理解、可操作,它就不应只属于模型。Show-Harness 团队进一步构建了GUMI(GUI-based Manipulation Interface),把同一套机器人语义动作单元呈现为浏览器中的图形控件和键盘快捷键。

这形成一个很自然的统一:

  • 人类操作者可以通过键盘远程 “玩” 机器人,不需要额外的专用遥操作硬件;
  • Computer-Use agent可以像操作网页一样操作同一个 GUI 来控制机器人;
  • VLM robot agent则可以直接预测同一套语义动作,而无需经过 GUI 点击。

每一步操作前的观察与被选择的语义动作会被记录成 (observation, action) 数据对。由于动作解释器同时保留相应的低层命令和轨迹,一份 demonstration data 既可用于训练基于 Show-Harness 的动作策略,也可转化为连续控制 policy 的数据;同样的流程还能覆盖单臂、双臂、仿真和真机,并允许人在 agent 执行过程中介入修正。



图 4:GUMI 将语义动作做成 GUI。左侧是双臂机器人控制界面,右侧展示 Computer-Use agent 通过浏览器操作同一界面。

论文中,团队通过 GUMI 在真实机器人上采集了 164 条遥操数据、约 7.8K 个决策步骤:其中 Franka 为 101 条(5.0K 步),AgileX 为 63 条(2.8K 步)。仿真部分则收集了 230 条遥操数据、13.5K 个决策步骤,覆盖 ManiSkill 与 RoboLab 两个环境。

从更高的视角来看,GUMI 不只是一个数据采集工具。它把人类控制、GUI agent 控制和 VLM 直接控制对齐到同一动作语义中,让 “人如何示范”“Agent 如何操作”“模型如何学习” 不再是彼此割裂的三条管线。

同一套动作接口,跨模型、跨本体、跨任务

这套语义动作接口的目标不是绑定某一个特定的模型,而是成为 foundation model 和物理系统之间的通用层。论文首先从模型、机器人本体和任务三个维度展示了同一接口的适用范围。

跨模型。对闭源 frontier VLM,Show-Harness 无需微调即可进入真实机器人的闭环;对小型开源 VLM,可在同一动作空间上进行轻量适配。论文默认使用 Qwen3.5-2B,仅在语言模型线性层加入 rank-64 LoRA,冻结视觉编码器和多模态投影层,更新约 3% 参数。

跨机器人本体。论文中的实验覆盖 7 自由度的 Franka 和 6 自由度的 AgileX(含双臂场景)。模型面对的是同一套语义动作接口,底层由各平台的动作解释器完成落地。需要强调的是:zero-shot 模式通过更换底层控制解释器切换具机器人本体;轻量后训练模式则使用两种平台收集的 demonstration 数据进行联合训练。

跨任务与环境。真机任务演示从日常 pick-and-place,扩展到陌生物体、背景 / 光照 / 视角 / 干扰物变化、空间推理,以及双臂开抽屉等操作。首图中的擦除文字、双臂折衣服、将笔放入笔筒、切蛋糕等场景,也展示了这套动作抽象可以承载比标准抓放更丰富的任务过程。



图 5:真实机器人上的泛化演示,包括新物体、环境变化、空间推理和双臂操作。

真机上的三层泛化

进一步地,Show-Harness 在真机实验上从跨任务、跨环境、跨本体三个维度来综合评测泛化能力。下表中的 ZS 为零样本 frontier VLM,FT 为轻量后训练的 Qwen3.5-2B;每项为对应设置下的平均成功率。



此外,在 sim-to-real 实验中,FT 模式仅使用通过同一界面收集的 230 条仿真示范训练,迁移到真实 Franka 后完成 13/20 次任务;论文中的可训练 VLA 对比方法在该设置下均为 0/20。

当然,这些任务成功率的数字并不意味着 “机器人控制已经解决”。更准确的解读是:在论文测试的操作任务与分布变化中,一个语义上足够清晰、物理上足够细粒度的接口,可以让 frontier model 的现有能力更好地转化为可执行的机器人控制,也可以让小模型以较低的成本获得更强的迁移性。



图 6:论文对精细控制、旋转外推、动作组合、工作空间变化、多臂协作、推理任务与 in-context learning 的进一步分析。

前面的实验展示 Show-Harness 在任务、环境和具身变化下的广泛泛化能力。一个更困难的问题是:Show-Harness 在多大程度上能让 foundation model 适应新的物理与语义需求?为此,如上图所示,团队通过一系列针对性场景考察了两种互补的适应能力:物理适应性,即无需重新训练策略,便能应对运动精度、动作组合、工作空间和具身形态的变化;以及语义适应性,即处理需要推理,或需要从新示范中进行 in-context learning 的任务。



图 7:动作命名与物理约定的 2×2 控制变量实验。

另一组实验则进一步解释了接口的作用:把直观的动作名称换成 A–F,但保留明确的物理约定,成功率仍达到 95%;只保留语义名称、不解释约定,也能达到 90%;当名称和约定同时移除,成功率则降至 5%。也就是说,语义名称已经能够调用模型已有的空间先验,而明确、稳定的 “符号 — 物理效果” 约定,则是接口完成动作 grounding 的关键。

结语:Embodied Harness

是基座模型走向物理世界的接口

从 Computer-Use 到 Robot-Use,变化的其实不仅仅是环境:前者操作的是屏幕上的数字对象,后者面对的是存在不确定性、接触和安全约束的物理世界。但相同的是,它们都需要一个模型能够理解、又能把结果反馈回来的交互接口。

Show-Harness 提供了一种具体尝试:不是把 foundation model 的智能简单压缩进一组连续控制量,也不让它停在高层规划;而是在模型与机器人之间加入一个Embodied Harness,把多视角观察、推理、语义决策、具身解释与执行反馈组织为持续闭环。

也许未来 Computer Agent 和 Robot Agent 并不是两套完全独立的系统,而是 foundation model 通过不同接口与数字世界、物理世界交互的两种形式。如何设计这些接口,可能会成为把通用智能真正带入具身系统的一项关键工作。

延伸阅读:从 Show-Harness

到 Multimodal Embodied Agent

在 Show-Harness 之后,Show Lab 团队进一步发布了综述Survey on Multimodal Embodied Agents: From Computer-Use to Robot-Use,从单个系统进一步放大视野,讨论多模态 Agent 从数字环境走向物理世界时,能力结构与研究问题发生了哪些变化。

该综述以 Perceive → Anticipate → Plan → Act → Verify(PAPAV)为统一框架,梳理多模态 Agent、机器人系统及二者走向融合的研究版图;配套的 Awesome Repo 也将持续收录这一快速演进方向中的相关工作。

  • Awesome Repo:https://github.com/showlab/Awesome-Multimodal-Embodied-Agent
  • 项目主页:https://showlab.github.io/Awesome-Multimodal-Embodied-Agent/

作者信息:

本研究由新加坡国立大学 ShowLab 团队主导完成。

共一作者 Yanzhe Chen 陈彦哲(博士生), Zechen Bai 白泽琛(博士生),Zhijun Cao 曹植竣(硕士生)和 Wenzheng Zeng 曾文正(博士生)均来自 ShowLab@NUS,长期聚焦于多模态理解和具身智能相关研究。

项目负责人为新加坡国立大学校长青年助理教授 Mike Zheng Shou 寿政。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
董卿复出突生变故,人到北京节目被撤,知情人透露原因丝毫不意外

董卿复出突生变故,人到北京节目被撤,知情人透露原因丝毫不意外

明天去看太阳
2026-09-28 10:07:27
梅西小角度任意球世界波!生涯第931球,距历史第一仅差1球

梅西小角度任意球世界波!生涯第931球,距历史第一仅差1球

时光在作祟
2026-09-28 12:00:34
崩盘下课倒计时!热刺锁定欧洲第一少帅!完美复刻阿森纳阿尔特塔

崩盘下课倒计时!热刺锁定欧洲第一少帅!完美复刻阿森纳阿尔特塔

澜归序
2026-09-28 08:49:39
原来他就是刘欢亲弟弟,53岁是知名主持人,业余创作的歌家喻户晓

原来他就是刘欢亲弟弟,53岁是知名主持人,业余创作的歌家喻户晓

笑饮孤鸿非
2026-09-28 11:33:14
弘一法师:你以为失去一个为你撑伞的人会淋雨——其实分开后才发现,你的世界根本不下雨

弘一法师:你以为失去一个为你撑伞的人会淋雨——其实分开后才发现,你的世界根本不下雨

杏花烟雨江南的碧园
2026-08-19 15:15:03
李立群想带儿子回河南老家过中秋遭侄子拒绝!仅妻子女儿被接纳,发视频征求网友意见

李立群想带儿子回河南老家过中秋遭侄子拒绝!仅妻子女儿被接纳,发视频征求网友意见

火山詩话
2026-09-27 09:24:48
电影市场太惨淡了!今年中秋档的票房冠军是2019年的复联4,远超其他所有中秋档电影,评论区网友道破真相

电影市场太惨淡了!今年中秋档的票房冠军是2019年的复联4,远超其他所有中秋档电影,评论区网友道破真相

火山詩话
2026-09-27 06:23:59
中德关系要变天!魏德尔露出真实想法,批评中国,勒令德企后撤

中德关系要变天!魏德尔露出真实想法,批评中国,勒令德企后撤

李侽在北漂
2026-09-27 22:56:55
“爷爷黄毛,奶奶满背!”一家五口火了,孩子小学毕业就算高学历

“爷爷黄毛,奶奶满背!”一家五口火了,孩子小学毕业就算高学历

世界圈
2026-09-14 15:03:43
教育部原党组成员、副部长鲁昕被查

教育部原党组成员、副部长鲁昕被查

澎湃新闻
2026-09-28 10:28:27
军史上的沉默:刘伯承与徐向前,为何成了毛主席的“例外”?

军史上的沉默:刘伯承与徐向前,为何成了毛主席的“例外”?

纪史行者
2026-08-31 00:20:09
随着爱尔兰3-0,葡萄牙2-1,德国0-1,荷兰2-1,丹麦2-0,欧国联最新积分榜出炉

随着爱尔兰3-0,葡萄牙2-1,德国0-1,荷兰2-1,丹麦2-0,欧国联最新积分榜出炉

侧身凌空斩
2026-09-28 05:00:43
黑八预警!自由人击败山猫总分1-0 斯图尔特34+12韩旭5分2帽

黑八预警!自由人击败山猫总分1-0 斯图尔特34+12韩旭5分2帽

罗说NBA
2026-09-28 05:43:05
客胜联盟第一!中国女篮27岁2米07王牌闪耀季后赛:辅佐三巨头黑八?

客胜联盟第一!中国女篮27岁2米07王牌闪耀季后赛:辅佐三巨头黑八?

李喜林篮球绝杀
2026-09-28 10:58:14
上海最尴尬的大学出炉:2026首轮投档仅1人!网友还推测是误报

上海最尴尬的大学出炉:2026首轮投档仅1人!网友还推测是误报

华庭讲美食
2026-09-28 01:07:33
治阳痿早泄最狠的一味药,不花一分钱固肾固精,告别西地那非!

治阳痿早泄最狠的一味药,不花一分钱固肾固精,告别西地那非!

垚垚分享健康
2026-09-27 22:00:11
林彪致毛主席罕见书信,为何书法有的苍劲有力,有的却像印刷体!

林彪致毛主席罕见书信,为何书法有的苍劲有力,有的却像印刷体!

小豫讲故事
2026-08-21 06:00:11
上任以来,特朗普最大贡献就是:亲手促成了中国人对美国的祛魅

上任以来,特朗普最大贡献就是:亲手促成了中国人对美国的祛魅

军机Nova
2026-08-22 00:20:07
9月重磅定调!养老金改革迎来新方向,重点解决现实问题

9月重磅定调!养老金改革迎来新方向,重点解决现实问题

白昼说故事
2026-09-28 09:21:55
法国媒体确认了:以色列外交部长宣布,7天内将会撤销荷兰在约旦河西岸的外交官认证

法国媒体确认了:以色列外交部长宣布,7天内将会撤销荷兰在约旦河西岸的外交官认证

吉刻新闻
2026-09-28 11:51:55
2026-09-28 12:40:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14090文章数 142739关注度
往期回顾 全部

科技要闻

智能体惹了多少祸,OpenAI自己没查清!

头条要闻

供销社职工以46600元参与拐卖外籍妇女 获刑5年9个月

头条要闻

供销社职工以46600元参与拐卖外籍妇女 获刑5年9个月

体育要闻

114项指控成立,曼城已经完蛋了吗?

娱乐要闻

好汉刘欢:一副好嗓子,一颗赤子心

财经要闻

标价298元核桃油, 实为大豆油冒充

汽车要闻

神龙科技与Momenta达成全球战略合作 2027年起推新车

态度原创

旅游
游戏
家居
艺术
公开课

旅游要闻

广州南沙中秋接待游客超104万人次,多元演艺点燃文旅消费

《堡垒之夜》2026全球赛冠军出炉,获40万美元奖金

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

12张效果图,抖音深圳第二总部显真容

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版