网易首页 > 网易号 > 正文 申请入驻

破局单模型局限!清华大学李秀教授团队提出EMERGE-Policy:以多智能体协作迈向「具身智能系统」时代

0
分享至



在长期的机器人操作 (Robot Manipulation) 的研究中,单模型 (如视觉语言动作模型,Vision-Language-Action, VLA) 被广泛研究。然而,单一种类模型难以应对复杂的长程任务与突发干扰。



视频链接:https://mp.weixin.qq.com/s/aPjlKTb7A_dMH7KtrVd2qg

为此,清华大学深圳国际研究生院智能计算实验室硕士生方智睿,于清池,陈子扬等在李秀教授的指导下,联合多家高校推出了全新的多智能体异步并发框架 ——EMERGE-Policy。它打破了过去各项技术割裂研究的局面,将 VLA、WAM、世界模型、验证器等不同架构和用途的模型整合为系统可调用的「多元工具集」。

该框架打破了「单一 Policy 决定一切」的传统范式,通过主智能体 (Main Agent)、角色化子智能体 (Sub Agents) 与统一技能库 (Skill Library) 的闭环协作,向具身智能领域做出「我们需要怎样的具身智能系统架构?」的回答。



  • 论文标题:EMERGE-Policy: A Rob ot Mind Emerges Beyond a Single Policy
  • 论文地址:https://arxiv.org/abs/2608.29896v2
  • Website: https://emerge-policy.github.io/EMERGE-Policy/
  • Code: https://github.com/EMERGE-Policy/EMERGE-Policy
  • 清华智能计算实验室官网:https://thusigsiclab.github.io/thu.github.io/

破局「分而治之」:从单一模型到多模型集成具身智能系统

Annie Murphy Paul 在《延展的意识》中写道:「在大脑之外思考,意味着巧妙地借助头脑之外的实体。」(「Thinking outside the brain means skillfully engaging entities external to our heads。」)

在以往的具身智能研究中,大家往往追求用单个「端到端模型」解决问题。然而,单模型在面对复杂的长程任务时,频繁的低级感知数据处理,高层规划器的上下文思考和细粒度的动作输出等任务往往不能很好的兼容,导致逻辑混乱或累计误差崩塌。

EMERGE-Policy 提出了全新的「具身智能系统」范式:智能不应拘泥于某一个模型,而是通过图结构 Agent 的编排异步并发的处理任务,将各类专项模型作为「工具」统一调度,让系统级智能在多组件的协同互动中「涌现」(Emerge)出来。

这样的系统架构和人类发挥智能的方式不谋而合:人在与环境进行交互的过程中通过视觉模块(眼睛)感知环境,通过双手执行操作「技能」,通过大脑进行想象…… 不同异构的器官执行不同种类的技能。

基于 VLA、WAM、世界模型与验证器等模型的异构工具库

EMERGE-Policy 的核心突破在于其统一技能库(Unified Skill Library)的设计。它不再把各种主流操作模型视为相互竞争的替代方案,而是将它们全部封装为标准化的工具接口,融合进同一个具身智能系统中(见图 1):



图 1:EMERGE-Policy 系统及其协调组件的总体架构

按图 1 所示,Emerge-policy 将技能分为 3 类:

  • 操作技能(Operational Skills):VLA, motion planner 与 WAM. VLA(Vision-Language-Action)模型:作为低级视觉 - 语言 - 动作映射工具,专注于高频、精确的机器人末端轨迹与物理控制生成(EMERGE-Policy 中采用 pi_{0.5})。运动原语:在众多操作任务当中,作为宽域动作或宏观动作生成工具,在粗粒度或大范围运动规划时快速响应。
  • 想象与预测技能(Imagination Skills):世界模型(World Model)将世界模型(WM)(如 Cosmos Policy 等)引入工具链。系统在真正执行动作前,可调用世界模型作为「仿真器」,预测未来可能生成的视频状态,实现「想好了再做」。
  • 评估与校验技能(Evaluation & Verification Skills):验证器(Verifier Model)集成评价与验证器模型,在动作执行前校验前提条件(Preconditions),在动作执行后校验目标完成度(Completion Criteria),在预演阶段为世界模型预测的多种候选路径进行打分筛选。

结合了想象技能以及评估技能的动作使得操作过程能考虑 “后验” 得更好完成任务,其工作机制如图 2.



图 2:带想象力和评估技能的动作选择与不带想象力的评估

系统级架构:精细分工的图结构调度

在大模型 agent 工程范式变革历史中,从 prompt engineering 到 harness engineering 再到 loop engineering,AI agent 开始设计多个过程(往往就是多个 loop)之间的关系 —— 谁在谁之前、谁能并行、谁的输出喂给谁。

(1) 主智能体(Main Agent):决策和调度中枢

如图 3,主智能体维持全局任务状态,将复杂的长程任务拆解为子目标(Subgoals)。通过分层上下文工程(Hierarchical Context Engineering),Main Agent 屏蔽掉冗余的低级感知数据,只通过结构化接口调用子 Agent 与工具库。



图 3:主代理的协调与反馈流程

(2) 角色化子智能体(Sub-Agent):独立的专职单元

子智能体运行在隔离的上下文环境中,协助处理高密度的专有数据。

  • Perception Sub-Agent:感知场景 3D 边界框与空间语义;
  • Verification Sub-Agent:实时调用验证器工具检查目标完成度;
  • Monitor Sub-Agent:监控执行过程中的物理异常。

(3) 三层外记忆和上下文管理机制

为保证长程任务不失忆,系统引入了三层文件级记忆(见图 4):

  • PLAN.md:记录任务图与当前进度;
  • HISTORY.md:追加存储历史观测与工具调用摘要;
  • MEMORY.md:动态修正更新的环境事实。

当上下文达到上限时,系统自动触发 Memory Integration 压缩历史,保证系统在超长时序下的稳定运行。



图 4:三层记忆与上下文管理

实验结果:全方位刷新 Benchmark,真机表现惊艳

EMERGE-Policy 研发团队在LIBERO、LIBERO-Plus、LIBERO-Pro 以及 RoboDojo四大被广泛采用的基准及真实机器人上进行了全面评估:

(1). 在 Standard LIBERO 上,得益于将 Cosmos Policy 作为世界模型技能进行轨迹想象和动作选择,EMERGE-Policy 取得了99.2%的平均成功率(超越底座模型 0.7%);在以 pi_{0.5} 作为执行技能的 robot policy 后,平均成功率达到了98.8%(超越底座 2.0%)。

(2). 在面对各种光照变幻、相机位姿突变的 LIBERO-Plus 扰动测试中,EMERGE-Policy (w/ WM) 取得了 93.9% 的超高完成率,比单一 Cosmos Policy 基础底座大幅提升了 11.7%(libero 系列的实验结果可见图 5)



图 5:Libero, LIBERO-Plus, Robodojo 和真机实验的不同维度的效果对比

(3) 在测试视觉记忆与长程规划的 RoboDojo-Sim 测试中,EMERGE-Policy 在 Memory 维度取得了 25.00/22.51%(score/success rate) 的优异成绩,Open 维度取得了 19.98/11.20% 的成绩,这样的指标远超同类型的其他模型(见表 1 和图 5)这表明其具备强大的历史信息编码能力和非马尔可夫推理能力,在技能重组以及开放词汇语义与动作的对齐方面表现尤为出色。



表 1:EMERGE-Policy 在五个 RoboDojo-Sim 能力维度上的结果。每项数据报告了五个能力维度的得分和成功率(%),以及它们的平均值。

(4) 真实机器人部署:多层纸杯叠放长程任务为例。EMERGE-Policy 团队在真实机械臂上部署了高难度的「多层纸杯叠放(Multi-layered Cup Stacking)」任务(见真机实验视频演示和图 6a)。机器人需要将桌面上的纸杯依次倒扣、定位并精准堆叠成 3-2-1 的三层金字塔。



视频链接:https://mp.weixin.qq.com/s/aPjlKTb7A_dMH7KtrVd2qg



图 6:真实机器人多层纸杯叠放工作流与实验结果

高稳定度:在 100 次标准真机实验中,EMERGE-Policy 具身智能系统展现出了极高的完成度(见图 6b)。

强抗干扰:面对人为破坏(将叠好的纸杯拆毁)、纸杯尺寸变化(5%-15%)、颜色变幻及相机视角变动时,系统凭借分支栈恢复与工具库的在线重规划,依然保持了 85%-94% 的惊人成功率(见图 6c)。

结语

EMERGE-Policy 成功开辟了一条具身智能研究的新路径:我们无需强求单个模型无所不能,通过将 VLA、WAM、世界模型与验证器解耦为协同工具,以图结构的理念将多智能体系统进行统一编排,能够构建出适应力极强、高鲁棒的全栈具身智能系统。

清华大学深圳国际研究生院智能计算实验室团队专注于模式识别,决策智能,具身智能研究方向。

未来,团队将进一步推出 EMERGE 系列工作,向具身智能领域阐述「如何做好现代具身智能系统」的团队观念!

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中俄达成共识,印度顶住压力,金砖发布首份联合声明,痛斥美霸权

中俄达成共识,印度顶住压力,金砖发布首份联合声明,痛斥美霸权

墨子翟的日记y
2026-09-13 14:52:33
婚姻心理学惊人铁律:丈夫不会为最贤惠的妻子停留,却会为一个让他“赢了自尊却输了柔软”的妻子彻底归顺,这是婚姻甘心被收服的终极密码

婚姻心理学惊人铁律:丈夫不会为最贤惠的妻子停留,却会为一个让他“赢了自尊却输了柔软”的妻子彻底归顺,这是婚姻甘心被收服的终极密码

心理观察局
2026-09-13 07:32:05
许华升与妻子婷婷爆发婚姻危机!婷婷控诉其一年365天,360天喝酒

许华升与妻子婷婷爆发婚姻危机!婷婷控诉其一年365天,360天喝酒

裕丰娱间说
2026-09-11 10:17:32
心理学家指出:两人有过一次同床经历后,若再遇机会,便会重复第二次、第三次,乃至更多次,此乃人性使然

心理学家指出:两人有过一次同床经历后,若再遇机会,便会重复第二次、第三次,乃至更多次,此乃人性使然

心理观察局
2026-09-13 06:49:05
前美网冠军莎拉波娃与美网青少年冠军孙心然合影,早在八年前有过交集

前美网冠军莎拉波娃与美网青少年冠军孙心然合影,早在八年前有过交集

生性洒脱
2026-09-13 17:15:01
付航脱口秀1000张黄牛票无法入场,观众喊退票,罗永浩发文:主办方此举不妥当,黄牛是不可能禁掉的

付航脱口秀1000张黄牛票无法入场,观众喊退票,罗永浩发文:主办方此举不妥当,黄牛是不可能禁掉的

韩小娱
2026-09-13 09:31:02
穆帅在皇马4:1获胜后,表示皇马是高速度、高强度球队,总有一天能单场打进对手6-7球!

穆帅在皇马4:1获胜后,表示皇马是高速度、高强度球队,总有一天能单场打进对手6-7球!

福酱的小时光
2026-09-13 15:47:47
全新雷克萨斯RX:184kW混动,83km纯电,366匹6.2秒

全新雷克萨斯RX:184kW混动,83km纯电,366匹6.2秒

小怪吃美食
2026-09-13 20:31:58
广西一大爷,将“榴莲核”种成树,结出果子“20斤”,太牛!

广西一大爷,将“榴莲核”种成树,结出果子“20斤”,太牛!

奇思妙想生活家
2026-09-13 20:02:57
谁也没料到,分开 15 年的李泽楷,竟给已遇真爱的梁洛施,留下一副好牌

谁也没料到,分开 15 年的李泽楷,竟给已遇真爱的梁洛施,留下一副好牌

草莓解说体育
2026-09-13 09:00:12
一胜难求,伯恩利3平4负继续英冠垫底,39岁瓦尔迪替补迎首秀

一胜难求,伯恩利3平4负继续英冠垫底,39岁瓦尔迪替补迎首秀

懂球帝
2026-09-13 01:06:16
为了“掏空”老百姓的钱袋子,编造出来的四个谎言,谁信谁倒霉!

为了“掏空”老百姓的钱袋子,编造出来的四个谎言,谁信谁倒霉!

风信子的花
2026-05-26 19:06:10
深夜,歹徒闯入家中对她施暴近两个小时,她咬紧牙关一声不吭,只为保护楼上熟睡的女儿。当警察破门而入时,才发现这位母亲早已浑身是血

深夜,歹徒闯入家中对她施暴近两个小时,她咬紧牙关一声不吭,只为保护楼上熟睡的女儿。当警察破门而入时,才发现这位母亲早已浑身是血

人生录
2026-07-30 00:05:11
全民化债的时代已经来了

全民化债的时代已经来了

细说职场
2026-09-11 21:34:33
3亿欧豪购换来倒数第二!维拉主场1-2不敌森林,四轮仅积1分

3亿欧豪购换来倒数第二!维拉主场1-2不敌森林,四轮仅积1分

星耀国际足坛
2026-09-13 22:59:21
海上巨人号!人类造出最大巨轮,为何最终以3500万美元当废铁卖了

海上巨人号!人类造出最大巨轮,为何最终以3500万美元当废铁卖了

壹知眠羊
2026-09-13 07:12:47
笑抽了!苹果只用一场发布会,治好了中文互联网一批大侄子的折叠屏厌恶症,评论区依旧精彩!

笑抽了!苹果只用一场发布会,治好了中文互联网一批大侄子的折叠屏厌恶症,评论区依旧精彩!

谭谈社会
2026-09-11 11:01:44
比维尔茨更灾难!利物浦 1.4 亿水货全场摆烂,90 分钟仅 16 次触球

比维尔茨更灾难!利物浦 1.4 亿水货全场摆烂,90 分钟仅 16 次触球

澜归序
2026-09-13 08:59:11
莫雷加德重返巅峰登顶!4-1击败雨果,男单夺冠斩获1000点积分

莫雷加德重返巅峰登顶!4-1击败雨果,男单夺冠斩获1000点积分

乒谈
2026-09-13 20:56:40
今明两年,不要随便买“新能源车”!内行人:有这3个原因很现实

今明两年,不要随便买“新能源车”!内行人:有这3个原因很现实

沙雕小琳琳
2026-09-13 12:30:03
2026-09-13 23:51:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13985文章数 142733关注度
往期回顾 全部

科技要闻

三位AI大佬,罕见呼吁AI减速

头条要闻

烧烤店被检查15次致停业 12345:同一举报人投诉116次

头条要闻

烧烤店被检查15次致停业 12345:同一举报人投诉116次

体育要闻

魔术是今夏市场上最安静的球队

娱乐要闻

敬一丹留给世间最后的温柔

财经要闻

蔡昉:农民工落户可释放万亿消费潜力

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

手机
艺术
本地
公开课
军事航空

手机要闻

华为Mate XT2麒麟9050 Pro实测出炉,游戏体验比肩骁龙8至尊

艺术要闻

被称作 "愤怒者" 的画家,把文艺复兴画成了风暴

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

伊朗总统强硬发声:伊朗不会向美国投降

无障碍浏览 进入关怀版