![]()
你有没有想过,一个机器人手臂伸出去抓一把勺子的时候,它到底"知道"自己在干什么吗?
听起来这是个很奇怪的问题。机器人不就是照着训练数据里的动作学一遍,然后在新场景里重复类似的轨迹吗?确实,目前大多数机器人大模型就是这么训练的。但POSTECH(浦项科技大学)的研究者们发现了一个很反直觉的现象:如果只教机器人"该做什么动作",而不告诉它"这个动作是为了达成什么目的",它的表现会明显更差。而一旦你把"目的"这件事显式地教给它,同一个模型在SimplerEnv-Bridge这个基准测试上的成功率能从64.3%直接跳到84.7%,整整涨了20个百分点。
这不是一个小修小补的调参技巧。这背后藏着一个关于机器人到底该怎么"理解"自己动作的根本性问题。
**机器人的动作学习一直卡在一个盲区**
我们先说说现状。现在主流的机器人控制模型叫VLA
VLA:Vision-Language-Action的缩写,指能把视觉画面和语言指令一起转换成机器人动作指令的模型,是当前机器人智能的主流架构。
VLA模型的训练方式基本上都是"行为克隆"
行为克隆:一种最朴素的模仿学习方法,就是给模型看大量的人类示范动作,然后让它学会在类似场景下复现同样的动作,本质是一种监督学习。
这套办法在过去几年支撑了RT-1、RT-2、OpenVLA、π0这些明星模型的进步,效果确实不差。但问题也很明显:机器人学到的只是"这个场景下该做这个动作",它并不知道这个动作是为了让绿色方块叠到黄色方块上,还是为了把勺子放到毛巾上。指令、观察、动作三者之间的因果链条,行为克隆完全没有显式建模。
后来有一批研究者意识到这个问题,开始给VLA模型加"未来监督",也就是让模型预测未来的画面、生成的子目标图像,或者物体的运动轨迹、光流场。这确实比纯粹的行为克隆进了一步,模型多少能预判一点"接下来会发生什么"。但这类方法有个共同的短板:它们捕捉的是行为的某一种具体实现方式,而不是这个行为背后共享的语义目标。
这句话有点绕,换个说法。假设你在教一个厨房机器人"把胡萝卜放到盘子里"和"把小篮子放进大篮子里"这两个任务。虽然两个任务的物体、动作轨迹完全不同,但它们在执行过程中都要经历"接近、抓取、搬运、放置"这四个阶段。反过来,同样是"接近"这个阶段,在不同任务里服务的目的完全不一样。未来帧预测、轨迹预测这类方法只盯着"下一帧长什么样""物体怎么移动",却没有回答一个更根本的问题:"这个动作是为了达成什么"。
这就是这篇论文要解决的核心矛盾:动作解码器需要理解自己动作背后的局部目标,而不只是记住动作本身或者预测未来的某个具体实现。
**INDI:把老师对行为的理解"蒸馏"进机器人大脑**
研究者提出的方法叫INDI
INDI:Intention Distillation的缩写,意为"意图蒸馏",是本文提出的核心方法,目标是把行为背后的语义目的教给机器人的动作解码器。
INDI的思路说起来不复杂,做起来挺讲究。核心是引入一个"教师模型"
教师模型:训练阶段使用的一个冻结参数、不参与实际部署的大型视觉语言模型,本文用的是英伟达的Cosmos-Reason2-8B,专门用来生成监督信号,推理时会被完全移除。
具体流程是这样的。对于一段大约1.6秒的机器人执行片段,教师模型会同时看四样东西:当前的图像观测、语言指令、一段粗略的动作文字描述(比如"末端夹爪向左上方移动然后闭合")、以及这段执行过程的视频。教师模型看完这些之后,要做两件事:一是在内部形成一个多模态的理解表征,二是生成一句大约30到50个词的功能性目的描述,比如"夹爪正在接近绿色方块以便抓取并叠放到黄色方块上"。
这里有个设计细节值得展开讲。研究者没有直接用教师模型生成的那句话作为监督信号,而是抓取了教师模型在处理输入证据(也就是图像、指令、动作摘要、视频这四样东西)时,中间某一层(第18层,教师模型一共大概36层左右)的隐藏状态,作为"意图目标"。这层隐藏状态既保留了多模态的细节,又已经完成了一定程度的语义抽象,比最后生成文字时的状态更接近这个片段真正想表达的"意思"。
这个设计决策背后有个反事实的验证。研究者专门做了对比实验:如果换成用教师生成完整回答之后的隐藏状态作为目标,而不是用处理原始证据时的隐藏状态,平均成功率会从85.5%掉到79.5%,少了6个百分点。这说明蒸馏"理解过程"比蒸馏"理解结果"更有效,教师还在消化信息的那个状态,比它已经组织好语言表达出来的状态,包含了更丰富、更贴近行为本质的信息。
这个设计选择让我想起一个很日常的场景。你请一个老木匠帮你评价一件家具做得好不好,他拿着家具翻来覆去看的时候,脑子里想的东西远比他最后跟你说的那句"做工还行,榫卯有点松"要丰富得多。他脑子里可能同时在比对材质纹理、榫卯角度、承重结构,这些信息在他说出评价那一刻已经被压缩成了一句概括性的话。如果你想学到老木匠真正的判断标准,直接抄他嘴里说的那句总结,不如去观察他翻看家具时的思考过程本身。INDI选择蒸馏"证据处理阶段"的隐藏状态,而不是"生成回答之后"的隐藏状态,道理是一样的:越早期的、越贴近原始信息的表征,信息密度反而越高。
那么,学生模型(也就是实际部署的机器人策略)要怎么"学会"这个意图呢?
这里用了一组可学习的"意图查询"
意图查询:在动作解码器里新增的一组可学习向量,作用类似于一个专门的探针,用来从当前观察、指令、机器人状态里主动"提取"出这段行为背后的意图表征。
论文在解码器的中间层(GR00T-N1.7用第16层,一共32层;π0.5用第9层,一共18层)插入这组意图查询,让它们和当前的图像观测、指令、机器人本体状态做交互,尝试恢复出和教师模型产生的意图表征尽可能接近的东西。这个"接近"是用余弦相似度来衡量和优化的。
光是恢复出这个表征还不够,因为如果这个表征只是被拿来做一次性的对齐损失,它很可能只是个摆设,解码器完全可以绕开它,靠其他信息照样把动作预测出来。研究者为了让这个"意图"真正参与到后续决策里,专门设计了一套不对称的注意力机制。意图查询只能看到机器人状态和上下文信息,看不到带噪声的动作和其他辅助预测;而负责预测视觉结果、文字目的的"接地"表征,以及最终的动作预测,都必须依赖意图查询提供的信息才能往下走。
更狠的一招是"上下文丢弃"。训练时有一半的概率会强行切断动作预测和接地预测对原始上下文的直接访问通道,逼着它们只能通过意图查询这条路径获取信息。这就好比公司里本来员工可以直接找客户谈需求,现在突然规定所有需求必须先汇报给项目经理,员工只能通过项目经理转达的信息来干活。如果项目经理转达得含糊,员工干活就会出问题。这种设计逼着"意图查询"必须把信息传递得足够准确,不能敷衍了事,否则下游任务就会跟着一起表现变差。
除此之外,论文还加了一个叫"意图错配"
意图错配训练:一种对比式的正则化手段,训练时把批次内不同样本的意图表征随机打乱配对,强迫模型在"正确匹配的意图"和"打乱后的意图"之间产生明显的性能差异,从而确保下游预测真的依赖意图内容而不仅仅是意图这条通路的存在。
的训练技巧。具体做法是,拿正确匹配的意图表征算一遍后续损失,再拿一个从别的样本"借"来的、内容不匹配的意图表征算一遍后续损失,强制要求前者的损失必须比后者低出一个安全边际(论文里设为0.05)。这个操作很像考试时出的"排除法"题目:不仅要让模型答对,还要让它明确知道错误答案为什么是错的。
**除了意图,还配了两个"接地"表征来辅助**
光有意图这一个抽象表征还不够立体,研究者还配了两个更具象的辅助表征,分别叫视觉接地和文字接地。
视觉接地表征来自这段行为执行结束时的画面,用一个独立的冻结视觉编码器提取特征;文字接地表征则来自教师模型生成的那句功能性目的描述的最终隐藏状态。这两个表征分别从"最终会变成什么样子"和"用语言怎么描述这个目的"两个角度,给意图提供互相印证的支撑。
这里有个很聪明的处理,叫"自条件化"
自条件化:训练时先用一次不计算梯度的前向传播,预测出干净的接地表征,然后把这个预测结果加噪声重新注入到正式的训练流程里,避免模型在推理阶段依赖训练时才有的"标准答案"。
因为部署阶段是没有教师模型的,视觉和文字的"标准答案"根本不存在,所以不能让解码器的输入依赖这些标准答案。这个自条件化的技巧解决了训练和部署之间的这道鸿沟。
单独看这两个接地表征各自的贡献,研究者做了详细的消融实验。只加意图不加接地,平均成功率76.0%;只加视觉接地能到81.0%;只加文字接地能到79.5%;两个一起上能到85.5%。有意思的是,两者一起带来的提升(9.5个百分点)比两者各自单独提升之和(8.5个百分点)还要多,说明它们之间存在协同效应,尤其是在"把茄子放进篮子"这个任务上表现得最明显——单用任何一个接地表征成功率大约73%,两个合在一起直接冲到100%。
**数据说话:INDI到底强在哪**
先看SimplerEnv-Bridge这个基准,涵盖四个桌面操作任务:把勺子放毛巾上、把胡萝卜放盘子上、叠方块、把茄子放篮子里。
| 方法 | 勺子 | 胡萝卜 | 叠方块 | 茄子篮子 | 平均 |
| GR00T-N1.7(基线) | 84.7 | 79.3 | 57.3 | 36.0 | 64.3 |
| GR00T-N1.7 + 未来监督 | 81.3 | 73.3 | 56.7 | 60.7 | 68.0 |
| **GR00T-N1.7 + INDI** | **88.7** | **84.7** | **69.3** | **96.0** | **84.7** |
差距最夸张的是"茄子放篮子"这个任务,基线只有36.0%,加了INDI之后飙到96.0%,整整提升了60个百分点。这意味着什么?意味着原来10次里差不多6次要失败,现在10次里最多失败1次。这已经不是渐进式的改善了,而是让一个原本不太可靠的动作变成了几乎可信赖的动作。
RoboCasa Kitchen这个更复杂的24任务家庭厨房基准上,INDI把用100条示范训练出来的GR00T-N1.7从64.1%提升到70.3%。更值得一提的是,这个70.3%的成绩,已经非常接近官方用3000条示范(整整30倍数据量)训练出来的GR00T-N1.7在同一基准上报告的70.8%。换句话说,通过教会机器人理解"意图",研究者用三十分之一的数据量,追平了靠堆数据才能达到的效果。
π0.5这个模型上也验证了同样的规律,在Bridge上从52.3%涨到58.8%,在RoboCasa上从34.9%涨到41.4%,尤其是"其他类"任务提升了14个百分点。这说明INDI不是针对某个特定架构的取巧优化,而是一个能跨模型迁移的通用规律。
真实机器人上的实验同样有说服力。研究者设计了四个真实世界桌面任务,穿环、嵌套篮子、跨箱堆叠、抽屉收纳,按操作难度和步骤长度递增排列。
平均成功率从62.0%涨到68.7%,而且这个提升在长任务上格外明显:跨箱堆叠提升7.3个百分点,抽屉收纳提升10.7个百分点,而两个较短的任务提升只有4到5个百分点。这个模式很有意思,它暗示着意图监督对"多阶段任务里保持目标一致性"这件事帮助最大。
想象一下你在教一个新手厨师做一道需要五个步骤的菜和一道只需要两个步骤的菜。两步的菜,哪怕新手不太清楚"为什么要这么做",照葫芦画瓢也基本能做对。但五步的菜,如果中途某一步他忘了整道菜最终要做成什么样,很容易在某个环节走偏,比如切完菜之后忘了接下来该炒还是该炖。步骤越长、越需要跨阶段保持目标感的任务,越依赖"知道自己在为什么而做"这件事。INDI在长任务上收益更大,恰恰印证了这一点。
**意图到底"是不是真的"?研究者做了一系列侦探式验证**
方法有效只是第一步,研究者接下来要回答一个更硬核的问题:这个被"恢复"出来的意图表征,到底是不是真的在起作用,还是仅仅提供了额外的模型容量而已?
他们做了一个很直接的测试:把恢复出来的意图表征在解码器中间层直接清零,其他所有输入保持不变。结果平均成功率从85.5%暴跌到45.5%,比什么都不加的基线(61.5%)还要低。
这个实验结果的意义在于,它排除了"意图表征只是个摆设"的可能性。如果解码器压根不依赖这个表征,清零之后成功率应该基本不变。但清零之后成功率反而比不加意图还低,说明解码器已经把这条通路变成了自己决策链条里不可或缺的一环,一旦这条链断了,其他部分反而更加无所适从。
更进一步,研究者还做了一个类似"移花接木"的实验:把某个任务(比如叠方块)恢复出来的意图表征,强行替换成另一个任务(比如放胡萝卜)的意图表征,同时保持其他输入不变,看看机器人会怎么"行动"。结果显示,注入相同目标的意图能维持84.5%的成功率,而注入不同目标的意图,成功率掉到45.2%,如果注入的是纯粹的高斯噪声,成功率直接跌到1.0%。
这个梯度变化说明了两件事:第一,意图表征里确实装着"具体是哪个任务"这个信息,不是随便什么向量都能替代的;第二,不同任务之间的"意图距离"也不是均匀的,论文进一步分析发现,勺子任务和胡萝卜任务的意图表征彼此最接近,而茄子篮子任务和其他任务的意图差异最大,这和这几个任务的场景、目标结构本身的相似程度是吻合的。
还有一个更细腻的实验,是把意图表征里代表"执行到哪个阶段"(比如早期、中期、后期)的那部分坐标强行替换。结果发现,如果强制注入"早期阶段"的意图,机器人会一直卡在"接近但不抓取"的状态,比如在胡萝卜任务上一直悬停在目标上方却不合上夹爪;如果强制注入"后期阶段"的意图,机器人会跳过抓取环节直接执行"放置"动作,比如在勺子任务上直接用空夹爪去按压毛巾,好像它以为自己已经拿到了勺子。
这组实验最打动我的地方在于,机器人的失败方式不是随机的胡乱动作,而是呈现出一种"阶段错位"式的规律性失败。这恰恰说明,意图表征里确实编码了"我现在处于任务的哪个阶段"这个信息,而且这个信息真实地驱动着后续的动作决策,不是花架子。
**教师模型的质量决定了一切的上限**
这篇论文还有一处很诚实的地方,研究者专门测试了换用不同"老师"会发生什么。
他们对比了三个候选教师模型:一个是没有做过物理世界相关训练的通用语言模型Qwen3.5-9B,一个是通用的视觉语言模型Qwen3-VL-8B-Instruct,还有一个是在Qwen3-VL基础上专门针对物理常识和具身推理做过后训练的Cosmos-Reason2-8B。
结果相当扎心:用Qwen3.5-9B当老师,平均成功率只有54.5%,比什么都不加的基线61.5%还要低,相当于蒸馏出来的意图不仅没帮上忙,反而拖了后腿。换成Qwen3-VL-8B-Instruct,成功率提升到73.5%。换成经过物理常识后训练的Cosmos-Reason2-8B,成功率进一步冲到85.5%。
研究者还专门量化分析了这三个教师产生的意图目标的"几何结构",发现Qwen3.5产生的目标几乎是"退化"的,不同样本之间方向差异极小,意味着模型几乎可以用一个近乎恒定的输出就能糊弄过这个对齐损失,根本没学到有意义的区分信息。而Cosmos-Reason2产生的目标,样本间差异明显更大,而且这种差异大部分来自"同一集里不同时刻"的变化,而不是"不同集之间"的静态差异,说明它捕捉的是行为随时间推进的动态信息,而不只是任务身份这种粗粒度标签。
这个发现其实挺让人警醒的。它说明INDI这套框架的效果上限,完全取决于你选的这个"老师"到底懂不懂物理世界里的因果关系。这就好比你请一个从没下过厨房、只在书本上读过菜谱的人来教你做菜,他嘴上能说出一堆专业术语,但真正涉及火候、手感这些需要实践经验的判断时,他给你的建议可能反而会误导你。如果不对教师模型的能力边界有清醒认识,直接把它的输出当作监督信号去蒸馏,很可能得到一个还不如不做的结果。
**计算成本其实很克制**
值得一提的是,这套方法虽然听起来结构复杂,但因为教师模型和所有目标生成模块都只在训练阶段起作用,部署时会被完全移除,所以额外开销并不夸张。
GR00T-N1.7加上INDI之后,参数量从34.55亿涨到35.02亿,只多了大约1.3%;单次推理时间从56.1毫秒涨到61.5毫秒,增加大约10%。π0.5上参数量只多了0.64%,推理时间增加约21%。这个代价相对于20个百分点的成功率提升,性价比是相当划算的。
写在后面
读完这篇论文,让我一直反复琢磨的一点是:我们平时评价一个人"做事靠不靠谱",很少只看他这一个动作做得标不标准,更多时候看的是他知不知道自己为什么这么做。这篇论文其实是把这个朴素的判断标准,第一次相对严谨地搬进了机器人训练这件事里。
有个细节我印象特别深。研究者做的那个"清零意图表征"实验,结果比什么都不加的基线还差。这说明一旦模型学会了依赖某种更高层的语义理解,它反而会在缺失这种理解的时候变得比原来更脆弱,这其实和人很像。一个从没被教过"为什么"的新员工,遇到没见过的情况可能还能凭本能应付一下;但一个已经习惯了先想清楚目标再动手的员工,如果你突然抽掉他判断目标的能力,他可能反而不知道手该往哪伸了。这种"能力越强,越依赖那个能力"的现象,值得在别的AI系统设计里也留个心眼。
论文里那组"教师质量决定上限"的实验,也让我对"用大模型蒸馏小模型"这套现在很流行的做法多了一层警惕。不是所有的蒸馏都天然有效,老师本身的理解深度,才是这套框架真正的天花板。
这篇论文没有回答的问题也很明确:机器人现在还只能被动地"接收"这一个由教师定好的意图,它没办法在执行途中怀疑这个意图对不对、也没办法在几个可能的目标之间自己权衡取舍。等哪天机器人能对自己接收到的"意图"说一句"我觉得这个不对",可能才是真正有意思的开始。
Q&A
Q1:INDI是什么?
A:INDI全称Intention Distillation(意图蒸馏),是一种让机器人视觉语言动作模型学会理解行为背后语义目的的训练方法,通过一个冻结的教师模型解读示范动作片段并生成意图表征,再让实际部署的机器人策略学会从常规输入里恢复出这种表征,用来组织动作预测。
Q2:INDI相比传统训练方法能带来多大提升?
A:在SimplerEnv-Bridge基准上,INDI把GR00T-N1.7的成功率从64.3%提升到84.7%,提升了20.4个百分点;在RoboCasa Kitchen基准上从64.1%提升到70.3%;真实机器人任务上平均成功率从62.0%提升到68.7%,长任务提升更明显。
Q3:INDI在部署时需要用到教师模型吗?
A:不需要。教师模型(论文用的是Cosmos-Reason2-8B)只在训练阶段用来生成监督信号,实际部署时会被完全移除,机器人策略只依赖自身对当前观测、指令和机器人状态的处理来恢复意图表征,额外的参数和推理开销都很小。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.