网易首页 > 网易号 > 正文 申请入驻

破局单模型局限!清华大学李秀教授团队提出EMERGE-Policy:以多智能体协作迈向「具身智能系统」时代

0
分享至



在长期的机器人操作 (Robot Manipulation) 的研究中,单模型 (如视觉语言动作模型,Vision-Language-Action, VLA) 被广泛研究。然而,单一种类模型难以应对复杂的长程任务与突发干扰。



视频链接:https://mp.weixin.qq.com/s/aPjlKTb7A_dMH7KtrVd2qg

为此,清华大学深圳国际研究生院智能计算实验室硕士生方智睿,于清池,陈子扬等在李秀教授的指导下,联合多家高校推出了全新的多智能体异步并发框架 ——EMERGE-Policy。它打破了过去各项技术割裂研究的局面,将 VLA、WAM、世界模型、验证器等不同架构和用途的模型整合为系统可调用的「多元工具集」。

该框架打破了「单一 Policy 决定一切」的传统范式,通过主智能体 (Main Agent)、角色化子智能体 (Sub Agents) 与统一技能库 (Skill Library) 的闭环协作,向具身智能领域做出「我们需要怎样的具身智能系统架构?」的回答。



  • 论文标题:EMERGE-Policy: A Rob ot Mind Emerges Beyond a Single Policy
  • 论文地址:https://arxiv.org/abs/2608.29896v2
  • Website: https://emerge-policy.github.io/EMERGE-Policy/
  • Code: https://github.com/EMERGE-Policy/EMERGE-Policy
  • 清华智能计算实验室官网:https://thusigsiclab.github.io/thu.github.io/

破局「分而治之」:从单一模型到多模型集成具身智能系统

Annie Murphy Paul 在《延展的意识》中写道:「在大脑之外思考,意味着巧妙地借助头脑之外的实体。」(「Thinking outside the brain means skillfully engaging entities external to our heads。」)

在以往的具身智能研究中,大家往往追求用单个「端到端模型」解决问题。然而,单模型在面对复杂的长程任务时,频繁的低级感知数据处理,高层规划器的上下文思考和细粒度的动作输出等任务往往不能很好的兼容,导致逻辑混乱或累计误差崩塌。

EMERGE-Policy 提出了全新的「具身智能系统」范式:智能不应拘泥于某一个模型,而是通过图结构 Agent 的编排异步并发的处理任务,将各类专项模型作为「工具」统一调度,让系统级智能在多组件的协同互动中「涌现」(Emerge)出来。

这样的系统架构和人类发挥智能的方式不谋而合:人在与环境进行交互的过程中通过视觉模块(眼睛)感知环境,通过双手执行操作「技能」,通过大脑进行想象…… 不同异构的器官执行不同种类的技能。

基于 VLA、WAM、世界模型与验证器等模型的异构工具库

EMERGE-Policy 的核心突破在于其统一技能库(Unified Skill Library)的设计。它不再把各种主流操作模型视为相互竞争的替代方案,而是将它们全部封装为标准化的工具接口,融合进同一个具身智能系统中(见图 1):



图 1:EMERGE-Policy 系统及其协调组件的总体架构

按图 1 所示,Emerge-policy 将技能分为 3 类:

  • 操作技能(Operational Skills):VLA, motion planner 与 WAM. VLA(Vision-Language-Action)模型:作为低级视觉 - 语言 - 动作映射工具,专注于高频、精确的机器人末端轨迹与物理控制生成(EMERGE-Policy 中采用 pi_{0.5})。运动原语:在众多操作任务当中,作为宽域动作或宏观动作生成工具,在粗粒度或大范围运动规划时快速响应。
  • 想象与预测技能(Imagination Skills):世界模型(World Model)将世界模型(WM)(如 Cosmos Policy 等)引入工具链。系统在真正执行动作前,可调用世界模型作为「仿真器」,预测未来可能生成的视频状态,实现「想好了再做」。
  • 评估与校验技能(Evaluation & Verification Skills):验证器(Verifier Model)集成评价与验证器模型,在动作执行前校验前提条件(Preconditions),在动作执行后校验目标完成度(Completion Criteria),在预演阶段为世界模型预测的多种候选路径进行打分筛选。

结合了想象技能以及评估技能的动作使得操作过程能考虑 “后验” 得更好完成任务,其工作机制如图 2.



图 2:带想象力和评估技能的动作选择与不带想象力的评估

系统级架构:精细分工的图结构调度

在大模型 agent 工程范式变革历史中,从 prompt engineering 到 harness engineering 再到 loop engineering,AI agent 开始设计多个过程(往往就是多个 loop)之间的关系 —— 谁在谁之前、谁能并行、谁的输出喂给谁。

(1) 主智能体(Main Agent):决策和调度中枢

如图 3,主智能体维持全局任务状态,将复杂的长程任务拆解为子目标(Subgoals)。通过分层上下文工程(Hierarchical Context Engineering),Main Agent 屏蔽掉冗余的低级感知数据,只通过结构化接口调用子 Agent 与工具库。



图 3:主代理的协调与反馈流程

(2) 角色化子智能体(Sub-Agent):独立的专职单元

子智能体运行在隔离的上下文环境中,协助处理高密度的专有数据。

  • Perception Sub-Agent:感知场景 3D 边界框与空间语义;
  • Verification Sub-Agent:实时调用验证器工具检查目标完成度;
  • Monitor Sub-Agent:监控执行过程中的物理异常。

(3) 三层外记忆和上下文管理机制

为保证长程任务不失忆,系统引入了三层文件级记忆(见图 4):

  • PLAN.md:记录任务图与当前进度;
  • HISTORY.md:追加存储历史观测与工具调用摘要;
  • MEMORY.md:动态修正更新的环境事实。

当上下文达到上限时,系统自动触发 Memory Integration 压缩历史,保证系统在超长时序下的稳定运行。



图 4:三层记忆与上下文管理

实验结果:全方位刷新 Benchmark,真机表现惊艳

EMERGE-Policy 研发团队在LIBERO、LIBERO-Plus、LIBERO-Pro 以及 RoboDojo四大被广泛采用的基准及真实机器人上进行了全面评估:

(1). 在 Standard LIBERO 上,得益于将 Cosmos Policy 作为世界模型技能进行轨迹想象和动作选择,EMERGE-Policy 取得了99.2%的平均成功率(超越底座模型 0.7%);在以 pi_{0.5} 作为执行技能的 robot policy 后,平均成功率达到了98.8%(超越底座 2.0%)。

(2). 在面对各种光照变幻、相机位姿突变的 LIBERO-Plus 扰动测试中,EMERGE-Policy (w/ WM) 取得了 93.9% 的超高完成率,比单一 Cosmos Policy 基础底座大幅提升了 11.7%(libero 系列的实验结果可见图 5)



图 5:Libero, LIBERO-Plus, Robodojo 和真机实验的不同维度的效果对比

(3) 在测试视觉记忆与长程规划的 RoboDojo-Sim 测试中,EMERGE-Policy 在 Memory 维度取得了 25.00/22.51%(score/success rate) 的优异成绩,Open 维度取得了 19.98/11.20% 的成绩,这样的指标远超同类型的其他模型(见表 1 和图 5)这表明其具备强大的历史信息编码能力和非马尔可夫推理能力,在技能重组以及开放词汇语义与动作的对齐方面表现尤为出色。



表 1:EMERGE-Policy 在五个 RoboDojo-Sim 能力维度上的结果。每项数据报告了五个能力维度的得分和成功率(%),以及它们的平均值。

(4) 真实机器人部署:多层纸杯叠放长程任务为例。EMERGE-Policy 团队在真实机械臂上部署了高难度的「多层纸杯叠放(Multi-layered Cup Stacking)」任务(见真机实验视频演示和图 6a)。机器人需要将桌面上的纸杯依次倒扣、定位并精准堆叠成 3-2-1 的三层金字塔。



视频链接:https://mp.weixin.qq.com/s/aPjlKTb7A_dMH7KtrVd2qg



图 6:真实机器人多层纸杯叠放工作流与实验结果

高稳定度:在 100 次标准真机实验中,EMERGE-Policy 具身智能系统展现出了极高的完成度(见图 6b)。

强抗干扰:面对人为破坏(将叠好的纸杯拆毁)、纸杯尺寸变化(5%-15%)、颜色变幻及相机视角变动时,系统凭借分支栈恢复与工具库的在线重规划,依然保持了 85%-94% 的惊人成功率(见图 6c)。

结语

EMERGE-Policy 成功开辟了一条具身智能研究的新路径:我们无需强求单个模型无所不能,通过将 VLA、WAM、世界模型与验证器解耦为协同工具,以图结构的理念将多智能体系统进行统一编排,能够构建出适应力极强、高鲁棒的全栈具身智能系统。

清华大学深圳国际研究生院智能计算实验室团队专注于模式识别,决策智能,具身智能研究方向。

未来,团队将进一步推出 EMERGE 系列工作,向具身智能领域阐述「如何做好现代具身智能系统」的团队观念!

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
香港住宅史上最大亏损纪录诞生:13.1亿的亏损额超过今年最贵豪宅成交价!

香港住宅史上最大亏损纪录诞生:13.1亿的亏损额超过今年最贵豪宅成交价!

红蓝白郁金香V
2026-09-13 18:42:44
周末重大利好!26万亿国家级大棋政策!A股估计要全面爆发

周末重大利好!26万亿国家级大棋政策!A股估计要全面爆发

风风顺
2026-09-14 00:00:06
特朗普女婿库什纳抨击乌克兰不愿投降,声称乌克兰妥协就可以结束战争

特朗普女婿库什纳抨击乌克兰不愿投降,声称乌克兰妥协就可以结束战争

山河路口
2026-09-13 20:42:27
卡里克称哈兰德进球判罚解释“令人震惊”

卡里克称哈兰德进球判罚解释“令人震惊”

赛场速报局
2026-09-14 03:15:58
敬一丹离世!退休断崖抑郁,晚年深陷绝境,女儿和丈夫成人生救赎

敬一丹离世!退休断崖抑郁,晚年深陷绝境,女儿和丈夫成人生救赎

孤城落日
2026-09-13 22:43:07
心理学家用40年研究发现:摆脱内耗的尽头不是“接纳”,不是“释怀”,而是你敢不敢正视埋在潜意识里的那两个思维陷阱

心理学家用40年研究发现:摆脱内耗的尽头不是“接纳”,不是“释怀”,而是你敢不敢正视埋在潜意识里的那两个思维陷阱

心理观察局
2026-09-10 07:13:07
谁都没想到,一场伊朗战争,打掉了美国20年的国运

谁都没想到,一场伊朗战争,打掉了美国20年的国运

农夫史记
2026-09-13 20:16:53
实锤!武汉大学举报事件后续,曾教授学术造假确凿,她还有退路吗

实锤!武汉大学举报事件后续,曾教授学术造假确凿,她还有退路吗

平老师666
2026-09-13 22:24:46
利好来袭,伊朗股市大涨

利好来袭,伊朗股市大涨

证券时报
2026-09-13 23:18:04
哈马斯的地道到底谁修的?挖到最深处,答案让所有人后背发凉

哈马斯的地道到底谁修的?挖到最深处,答案让所有人后背发凉

民间胡扯老哥
2026-09-08 06:45:58
马刺以令人费解的筹码期望交易凯里·欧文!代价非常巨大

马刺以令人费解的筹码期望交易凯里·欧文!代价非常巨大

夜白侃球
2026-09-13 10:58:51
算是踢到铁板了!这届日本亚运会,给全世界好好上了一课:没有中国,生意很难做

算是踢到铁板了!这届日本亚运会,给全世界好好上了一课:没有中国,生意很难做

扶苏聊历史
2026-09-10 14:58:19
难以置信!上海公交站台劝烟遭男子辱骂,女子次日蹲守拦车讨道歉

难以置信!上海公交站台劝烟遭男子辱骂,女子次日蹲守拦车讨道歉

小蜜情感说
2026-09-14 01:40:56
徐帆回应离婚才9个月,68岁冯小刚和养女贴脸拍照亲密 ,关系很好

徐帆回应离婚才9个月,68岁冯小刚和养女贴脸拍照亲密 ,关系很好

沧海一书客
2026-05-31 18:08:08
10人曼城1比0曼联,哈兰德:这是性格的胜利

10人曼城1比0曼联,哈兰德:这是性格的胜利

日常碎碎念啊
2026-09-14 03:44:51
孙女被富二代打进医院,对方宣称随便告,我转头拨通弟弟的电话

孙女被富二代打进医院,对方宣称随便告,我转头拨通弟弟的电话

五元讲堂
2025-09-09 15:08:08
最扎心的不是失业,是社保年限从15年涨到20年

最扎心的不是失业,是社保年限从15年涨到20年

职场资深秘书
2026-09-13 17:38:40
万万没想到!沙俄侵占的百万平方公里疆土,如今为何成“无人区”

万万没想到!沙俄侵占的百万平方公里疆土,如今为何成“无人区”

安珈使者啊
2026-09-13 10:22:06
女选手疑似赛场失禁,HYROX中国:将更换地毯,并开展全场深度消杀

女选手疑似赛场失禁,HYROX中国:将更换地毯,并开展全场深度消杀

大风新闻
2026-09-13 09:26:22
好惨!58岁华人网购廉价“潜水神器”,在浴缸里试用没问题,第二天下海却再也没能回家

好惨!58岁华人网购廉价“潜水神器”,在浴缸里试用没问题,第二天下海却再也没能回家

华人生活网
2026-09-13 05:40:59
2026-09-14 04:15:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13985文章数 142733关注度
往期回顾 全部

科技要闻

三位AI大佬,罕见呼吁AI减速

头条要闻

烧烤店被检查15次致停业 12345:同一举报人投诉116次

头条要闻

烧烤店被检查15次致停业 12345:同一举报人投诉116次

体育要闻

魔术是今夏市场上最安静的球队

娱乐要闻

敬一丹留给世间最后的温柔

财经要闻

蔡昉:农民工落户可释放万亿消费潜力

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

教育
艺术
手机
本地
亲子

教育要闻

10岁孩子做题3分钟就哭,48岁影帝考2年今天读博:我们的教育缺了一堂“慢课”

艺术要闻

画家查尔斯:把光画活,把色用绝,美得让人说不出话!

手机要闻

iPhone17三巨头霸榜,2026 W36销量第四名,竟是这台“塑料机”?

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

亲子要闻

“我的丈夫上班也很累,为什么要给妇产科的其他孕妇让座?”

无障碍浏览 进入关怀版