网易首页 > 网易号 > 正文 申请入驻

当模型学会走捷径时,我们该表扬还是该担心

0
分享至


先说一件挺反常识的事。

字节跳动的研究团队训练了一个80亿参数的模型,让它去学一个270亿参数的老师模型怎么用工具。按理说,学生怎么也应该比老师差一截才对,毕竟参数量差了三倍多。但结果是,这个学生模型在FTRL、ToolHop、τ-bench三个基准测试上,成绩反超了老师。

这不是个例,也不是运气。论文里专门画了张图,学生模型和老师模型的分数摆在一起对比,学生在多个任务上的柱子比老师的还高。一个更小的模型,用更少的参数,打败了教它的那个更大的模型。

这事儿要是发生在人类身上,大概相当于一个刚毕业的学徒,跟着老师傅干了几个月,结果做出来的活儿比老师傅还利索。听起来有点不合常理,但这篇论文恰恰就是在讲,为什么会发生这种事,以及背后那套训练方法到底动了什么手脚。

教AI用工具,到底难在哪儿

先搞清楚背景。现在的大语言模型光靠自己脑子里存的知识是不够的,你问它今天的天气、最新的股价、某个API接口该怎么调,它答不上来,因为这些信息它训练的时候根本没见过。所以现在流行的做法是给模型配上工具,让它自己去调用搜索引擎、执行代码、访问数据库,靠这些外部手段把答案凑出来。

这个能力目前主要掌握在那几个超大杯模型手里,比如Claude、Gemini这类前沿模型,参数规模动辄几百上千亿,普通公司和研究者根本用不起也跑不动。于是大家就想了个办法:让小模型跟着大模型学,这个过程叫智能体蒸馏。

智能体蒸馏*:把大模型(教师)在复杂任务上展现出的规划和工具调用能力,转移到一个更小、更便宜的模型(学生)身上的过程。

问题出在"怎么学"上。目前最主流的做法叫行为克隆或者监督微调,说白了就是把老师完整走过的一条路径录下来,让学生原样照抄,一步不差。这个思路听着挺合理,老师做对了,学生跟着做一遍不就会了吗?

但现实情况复杂得多。很多任务并不是一条单行道,而是有很多个子目标,这些子目标之间谁先谁后根本不重要。比如你要查一个人的生日和他的出生地,这两件事完全可以先查哪个都行,也可以同时查。老师这次示范可能是先查生日再查出生地,学生下次自己做的时候可能反过来了,或者用了别的搜索词,走了一条完全不一样但同样正确的路。

如果这时候你逼着学生逐字逐句模仿老师的原始路径,会发生什么?

模型会把学生这条本来正确的探索路径,硬生生往老师的路径上纠偏,哪怕学生走的是另一条同样能到达终点的路。这就好比你正在用自己的方法解一道数学题,方法完全没错,答案也对,但监考老师非要你把每一步都改成课本上标准解法的写法,哪怕你的方法更快更巧妙。长期这样训练,学生就会慢慢忘掉自己摸索出来的合理思路,只会死记硬背老师那一条路径,稍微变一下场景就懵了。

论文管这个现象叫拓扑坍缩。任务的最优解空间本来是个网状结构,很多条路径会在中间某个状态汇合,又从那里分岔出去,形成一种像钻石切面一样的复杂拓扑。传统训练方法把这种网状结构硬压扁成一条条孤立的直线,压扁的过程中,大量本来正确的探索路径被当成了错误路径来纠正。

那试试强化学习是不是就没这个问题了?也不行。目前主流的强化学习方法比如GRPO,是靠任务最终是否成功来给奖励,成功了就给整条路径上的所有步骤加分,失败了就都减分。这里的坑在于,一条走了十步最后失败的路径里,前面八步可能完全正确,只在最后两步出了错,但奖励信号是均匀撒在所有步骤上的,相当于把冤枉账算在了无辜的前八步头上。论文里管这叫信用误分配。

ISTG:把散落的路径拼成一张网

那怎么解决这个问题?研究团队的思路是,既然问题出在把网状结构硬压成线性结构,那就干脆别压扁,直接把这张网建出来。

于是他们提出了一个叫交互状态转移图的东西。

交互状态转移图(ISTG)*:把老师模型所有走过的成功和失败路径,统一映射到同一张有向图里。图上的每个节点代表一种"已经掌握了哪些信息"的状态,而不是某一次具体的动作。相同的信息状态即使是从不同路径到达的,也会被合并成同一个节点。

这句话听起来有点抽象,拆开讲。假设一个任务需要查两个信息:A和B。老师第一次示范是先查A再查B,第二次示范是先查B再查A。如果按传统方法,这是两条完全不同的轨迹,各自记一笔账。但在ISTG里,这两条路径走到"A和B都查到了"这个状态时,会被识别成同一个节点,因为不管顺序怎样,最终掌握的信息是一样的。

这就是论文标题里"钻石拓扑"的来源。两条路径从同一个起点出发,中间各走各的,但最后会在同一个信息状态上汇合,图形上看起来就像一颗钻石的切面,两条边分岔又合拢。

要建出这张图,第一步得先解决一个挺琐碎但很关键的问题:怎么判断两次工具调用返回的结果,说的是不是同一件事。比如一次调用返回的是一段自然语言描述,另一次调用返回的是一个结构化的JSON字段,内容其实说的是同一个事实,但表现形式完全不同。论文里设计了一个叫信息原子的抽象层,专门干这个事。

信息原子*:把不同工具、不同格式返回的、但实际内容等价的信息,统一归纳成同一个抽象单元。系统会先做一轮机械式筛选,把明显没有实质内容的返回结果(比如报错信息、空值、占位符)直接排除掉,剩下的再放到一起统一判断哪些说的是同一件事。

这一步的意义在于,只有把"同一件事的不同说法"识别出来,才能让两条表面不同但本质相同的路径在图上真正汇合,否则钻石拓扑根本建不起来,因为系统会误以为这是两条毫不相关的路径,各走各的,永远不会相交。

图里的节点还分两种类型,一种叫主节点,代表这一步真的获取到了新信息;另一种叫辅助节点,代表这一步做了些操作但没获得任何新东西,纯粹是无效探索。两种节点都会保留在图里,因为哪怕是无效探索,也反映了模型愿意多走几步去试错的行为特征,这个特征本身是有价值的,不该被直接抹掉。

找到那个"走偏"的临界点

图建好了,接下来的问题是:学生自己去闯的时候,如果闯失败了,到底是哪一步开始走偏的?

论文提出了一个概念叫关键拓扑断点,这是整个方法里最核心的一环。

关键拓扑断点(CTB)*:把学生自己走过的路径,逐步投影到老师已经验证过的、能够成功走到终点的区域里。一旦学生走到某一步,发现这一步再也无法对应到老师验证过的成功区域了,这一步就被标记为断点,断点之前的所有步骤都被认为是有效探索。

这里有个细节需要展开讲清楚,就是"成功可达区域"是怎么划定的。不是老师走过的所有节点都算数,论文设了一个预算上限,只有那些从当前节点出发、经过合理步数之内能走到成功终点的节点,才被纳入这个区域。这个预算是根据老师最短成功路径的长度,加上一定的容忍余量算出来的。换句话说,如果老师的某条路径绕了特别多弯路才成功,绕远的那部分不会被当作"值得学习的合理探索",只有性价比在合理范围内的路径片段才算数。

判断学生的某一步是不是能投影到这个区域,具体标准还分了两种情况。如果学生这一步是主节点,也就是获得了新信息,那就看这个信息集合是不是老师某个成功节点信息集合的子集,只要包含关系成立就算匹配,不要求完全相等。如果学生这一步是辅助节点,也就是无效探索,那就看学生此刻已经掌握的核心信息对应到老师哪个主节点,再比较学生和老师在这个主节点之后做了多少次无效探索,次数差不多就算匹配,具体试了哪个工具反而不重要。

这个设计其实挺巧妙的,它承认了"殊途同归"这件事:学生走的路不需要和老师一模一样,用的工具也不需要完全对应,只要最后攒下来的信息量和探索深度差不多,就认为学生走在正确的轨道上。

一旦发现学生从某一步开始,再也没法投影到这个成功区域了,那一步就是断点。断点之前,学生自己的探索被完整保留下来,不做任何修改。断点之后,才是需要纠正的部分。

这就像是给一辆正在跑山路的车装了个纠偏系统,但这个系统不是全程盯着方向盘随时纠正,而是只在车真的要冲出护栏那一刻才介入。如果没有这套断点识别机制,会发生什么?系统要么全程紧盯着方向盘不断微调,把司机自己找到的更顺畅的过弯路线全部抹掉;要么干脆全程撒手不管,等车已经翻进沟里了才想起来纠正,早就来不及了。断点识别的价值就在于,它精确定位了"车还没冲出护栏,但已经打滑"的那一瞬间,只在那个瞬间出手。

定位到断点之后,怎么教

找到断点只是第一步,接下来要生成一段"补救路径",教学生从这个断点开始该怎么继续走下去才能成功。

这里论文用了个叫增强生成器的东西,输入是任务本身、学生保留下来的前半段有效路径,再加上从老师图里随机抽取的一些参考轨迹(既有成功的也有失败的)。这个生成器的任务是根据这些信息,生成一段从断点开始的、能够走向成功的续接内容。

值得说的是,这些参考轨迹不会被直接原封不动地拼接到学生的路径后面,因为老师走的工具调用和拿到的返回结果,跟学生实际遇到的情况很可能对不上号。生成器只是"参考"这些轨迹的思路,然后结合学生实际的上下文,重新生成一段贴合学生当前处境的续接内容。

生成出来的这段补救内容,会拼在学生原本保留的前半段路径后面,构成一条完整的训练轨迹。然后是这套方法里另一个关键设计,叫断点引导的局部监督。

断点引导的局部监督*:在计算训练损失的时候,只对断点之后、生成的那部分补救步骤计算梯度,断点之前学生自己走出来的部分、以及工具返回的结果、最终答案这些内容,全部不计入损失,权重设为零。

这就是为什么这套方法能避免"一刀切"式的破坏性训练。传统的监督微调是把整条路径统统拿来计算损失,相当于老师改作业的时候,从头到尾每一个字都要按照标准答案打分,哪怕学生这道题的解法本身没问题,只是措辞和标准答案不一样,也会被扣分。而断点引导的局部监督,相当于老师只在学生第一次真正写错的地方开始批改,前面写对的部分完全不动。

这个类比其实还可以再往深处想一层。为什么"只改错的部分"比"全部重改"更好?因为学生自己摸索出来的合理写法里,往往藏着一些标准答案没有覆盖到的巧思,如果全部推倒重来,这些巧思就被连带抹掉了,学生学到的只剩下死记硬背标准答案这一件事,下次换个题目立刻抓瞎。而只改错的部分,学生自己那些正确又灵活的解法反而会被保留下来,成为他自己知识体系的一部分。

一轮不够,那就迭代着来

这套流程不是做一次就完了,论文把它做成了一个可以反复迭代的循环,叫渐进式自蒸馏。

渐进式自蒸馏*:每一轮训练结束后,用刚训练好的学生模型重新去跑一遍任务,收集新的失败案例,再重新定位断点、生成补救内容、做局部监督训练,如此反复迭代五轮。

这里有个很值得玩味的现象,论文专门做了统计。随着迭代轮数增加,断点出现的平均位置在不断后移,从第一轮的0.348一路推进到第五轮的1.452。这说明什么?说明学生第一次"走偏"的地方越来越靠后,能够独立正确完成的路径前缀越来越长。

这个过程有点像教小孩骑自行车。第一次尝试,孩子可能刚蹬两下就摔了,你在旁边扶一把,让他重新从摔倒的地方继续。练几次之后,孩子能骑十米才需要你扶一下了,再练下去可能能骑五十米。你每次介入的时间点都在往后推,这恰恰说明孩子自己能掌控的范围在不断扩大。如果每次都是从头扶到尾,孩子永远学不会自己判断什么时候该刹车、什么时候该拐弯。

更有意思的是,随着这个迭代过程推进,模型完成任务所需要的工具调用次数反而在减少,从第一轮平均4.23次降到第五轮的3.55次,而且最终比论文原始数据集里给出的标准答案路径(平均4.02次)还要短。这说明模型不是在死记硬背老师给的解法,而是真的学会了更聪明、更省事的做法,甚至找到了比原始标准答案更优的捷径。

结果到底怎么样

论文在FTRL、BFCL、ToolHop、τ-bench、RoTBench五个基准上做了测试,分别用了40亿和80亿参数两个规模的模型底座。

在80亿参数规模上,这套方法(论文简称DART-SD)拿到了42.00的Solve-P、54.13的Solve-R、45.66的Solve-F1,这三项都是所有对比方法里最高的,比标准监督微调(分别是38.08、50.95、41.89)高出不少,也比几种强化学习方法比如FTRL-GRPO、ToolRL都要强。在BFCL上拿到27.63分,虽然不是最高(FTRL-GRPO拿到35.25),但在τ-bench和RoTBench上都是最优。

在40亿参数规模上也是类似的趋势,Solve-F1达到39.77,是所有方法里最高的,同时BFCL上的23.88分也拿到了第一。

论文还专门做了个拆解实验,把这套方法拆成几个部件逐个加回去看效果。从只用自蒸馏(Solve-F1为38.10),到加上断点定位(39.51),再到加上渐进式迭代训练(43.93),最后加上完整的ISTG拓扑投影(45.66),每加一个部件分数都在往上涨,说明每个设计都在真正起作用,不是摆设。

除了工具调用能力,研究团队还专门测了一下这套方法会不会把模型原本的通用能力搞坏。他们在指令遵循、数学推理、通用知识几个标准测试上做了对比,结果显示用这套方法训练出来的模型,平均分从43.92涨到了49.89,比原始模型和标准监督微调都要好。这说明局部监督这个思路不光对工具调用任务有效,反而顺带保住甚至提升了模型别的方面的能力,可能是因为它没有像传统方法那样,用大量重复、僵化的模仿训练把模型原本灵活的表达能力给磨没了。

写在后面

读完这篇论文,最触动我的其实不是那些分数对比,而是"学生反超老师"这个结果背后隐含的一个判断:知识的转移不是复制,而是重组。

老师模型的能力藏在它走过的每一条路径里,但这些路径本身并不是知识,知识是路径背后那张更抽象的拓扑结构,就是什么状态该往哪走。传统的模仿式训练在复制路径的表面形式,而这套方法试图复制的是路径背后那张图。图比路径更抽象,也更本质,一旦学生真正吃透了这张图的结构,它甚至可以走出比老师任何一条具体路径都更优的方案,因为它掌握的不是某一条特定的走法,而是"怎么走都行,只要方向对"这个更高层的规则。

这让我想起小时候学琴,老师教一首曲子,如果只是让你把她弹的指法一模一样抄下来,你可能永远弹不出比她更好的版本。但如果老师教的是这段旋律背后的和声逻辑和情绪走向,你反而有可能弹出一个连她自己都没想到的、更打动人的版本。DART-SD做的事,某种程度上就是把"抄指法"换成了"教乐理"。

论文里还有一个细节我觉得特别值得单独说一说,就是那个断点位置随迭代不断后移的曲线。这条曲线其实是在给我们看模型能力边界扩张的实时轨迹,非常具体,非常可测量。它把一个通常很玄乎的说法,模型在变强,变成了一个可以画在坐标图上的数字。这种把抽象进步转化为可观测指标的思路,本身可能比这篇论文的具体方法更值得留意。

当然,这套方法目前建立在信息原子这套人工设计的抽象体系上,任务本身的信息结构需要能被清晰地拆解和归类。遇到那些没有明确"信息获取"概念、更依赖开放式创造和判断的任务,这套框架是不是还能奏效,论文里没有细说,这大概是留给后来者的一个问题。

Q&A

Q1:DART-SD是什么?

A:DART-SD是一种训练多轮工具调用智能体的新方法,核心思路是把执行过程建成一张交互状态转移图,识别学生模型走偏的关键断点,只对断点之后的部分做局部纠正训练,而不是像传统方法那样对整条路径做全局强制模仿。

Q2:为什么DART-SD训练出来的小模型能超过教它的大模型?

A:因为传统模仿训练会把学生自己摸索出的正确但和老师不一样的路径也强行纠正掉,导致学生只会死记硬背。DART-SD只保护学生已经走对的部分,只纠正真正出错的地方,学生因此保留并强化了自己更优的探索路径,最终在部分任务上反超了参数量大得多的教师模型。

Q3:关键拓扑断点是怎么找到的?

A:系统会把学生走过的每一步状态,投影到老师已验证过的成功可达区域中,一旦学生某一步再也无法对应到这个区域,那一步就被标记为断点,断点之前的探索完全保留,不做任何修改。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
稻盛和夫:不论你多富有、多有权势——生命结束时,所有一切都只能留在世界上,唯有灵魂跟着你走

稻盛和夫:不论你多富有、多有权势——生命结束时,所有一切都只能留在世界上,唯有灵魂跟着你走

杏花烟雨江南的碧园
2026-09-11 16:15:03
炸裂!日本妻子拍AV挽救婚姻,瞒夫出道老公崩溃,如今丈夫成粉丝

炸裂!日本妻子拍AV挽救婚姻,瞒夫出道老公崩溃,如今丈夫成粉丝

悠悠说世界
2026-08-17 13:48:27
心理学:雄性越是主动献殷勤越是拼命展示价值,越说明他对这场博弈心知肚明,当他突然不再表演了,不是放弃了而是雌性已经上钩了

心理学:雄性越是主动献殷勤越是拼命展示价值,越说明他对这场博弈心知肚明,当他突然不再表演了,不是放弃了而是雌性已经上钩了

心理观察局
2026-09-09 07:13:06
摸臀女开始哭了,开始博同情了,又发视频吐槽要说法了,哭到心率 120!呕吼!

摸臀女开始哭了,开始博同情了,又发视频吐槽要说法了,哭到心率 120!呕吼!

魔都姐姐杂谈
2026-09-12 03:40:03
1947年国军会议上,郭汝瑰怒斥胡琏:你和刘伯承同村,怎么让他跑了?

1947年国军会议上,郭汝瑰怒斥胡琏:你和刘伯承同村,怎么让他跑了?

凉州辞
2026-09-11 16:30:03
对哈登掏心掏肺,但对其他人就不一定了!骑士下赛季或要拆阵容

对哈登掏心掏肺,但对其他人就不一定了!骑士下赛季或要拆阵容

老梁体育漫谈
2026-09-12 00:20:11
陈盛燃“北上”履新,曾长期在广东工作

陈盛燃“北上”履新,曾长期在广东工作

星岛记事
2026-09-11 23:04:34
A股:暴跌,黑周五,牛市为何"突然跳水"?原因有三点!

A股:暴跌,黑周五,牛市为何"突然跳水"?原因有三点!

风风顺
2026-09-12 03:30:03
23分大胜世界第三!西班牙女篮破八年魔咒 37岁老将吐舌庆祝超开心

23分大胜世界第三!西班牙女篮破八年魔咒 37岁老将吐舌庆祝超开心

颜小白的篮球梦
2026-09-11 09:27:03
许家印为何骗不了李嘉诚——

许家印为何骗不了李嘉诚——

跟着老李看世界
2026-09-11 13:37:21
爆单、扩产!光模块概念股又火了

爆单、扩产!光模块概念股又火了

证券时报
2026-09-11 22:38:04
根本不用等几十年,如今很多高层住宅,事实上已经沦为“贫民窟”

根本不用等几十年,如今很多高层住宅,事实上已经沦为“贫民窟”

快乐彼岸
2026-09-11 20:09:08
3分钟2球!4-0大胜!时隔1003天重返欧冠 9.2亿豪门开门红

3分钟2球!4-0大胜!时隔1003天重返欧冠 9.2亿豪门开门红

狍子歪解体坛
2026-09-11 04:53:40
三星嘲讽苹果折叠屏:五十步笑百步,真正的卷王根本不带他俩玩

三星嘲讽苹果折叠屏:五十步笑百步,真正的卷王根本不带他俩玩

王新喜
2026-09-10 15:15:47
西甲;皇马刚在联赛摔了跟头,回头就碰同城“小老弟”,这三分不能再丢了

西甲;皇马刚在联赛摔了跟头,回头就碰同城“小老弟”,这三分不能再丢了

有态度网友19JHTd
2026-09-12 02:41:20
勇士队格林2023年差点加盟灰熊队:每年薪水比勇士队高1000万美元

勇士队格林2023年差点加盟灰熊队:每年薪水比勇士队高1000万美元

好火子
2026-09-12 04:50:41
不生病口诀,总共4句,建议每个人都背下来!

不生病口诀,总共4句,建议每个人都背下来!

品读时刻
2026-09-10 09:08:30
CPI落地后的大A全局推演:加息概率正在上升,A股已提前定价

CPI落地后的大A全局推演:加息概率正在上升,A股已提前定价

风风顺
2026-09-12 03:20:04
局势反转!马科斯没想不到!不是莎拉倒台,而是被老杜一家穷追猛打

局势反转!马科斯没想不到!不是莎拉倒台,而是被老杜一家穷追猛打

麓谷隐士
2026-09-11 12:44:47
我和前妻离婚半年了,昨晚喝醉后给她发了条信息:能回来睡一晚吗

我和前妻离婚半年了,昨晚喝醉后给她发了条信息:能回来睡一晚吗

千秋文化
2026-08-24 20:22:09
2026-09-12 06:04:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9842文章数 568关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

18岁女子加前男友微信被现男友发现 争吵后跳楼身亡

头条要闻

18岁女子加前男友微信被现男友发现 争吵后跳楼身亡

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

女装“玖姿”母公司跨境贸易迷局:安正时尚说谎了吗?

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

健康
时尚
手机
艺术
公开课

手脚发麻口齿不清?也可能是中风!

衣服别总是只穿黑色,看看这几款蓝色单品,清爽高级不过时

手机要闻

豆包手机二代下周发布!努比亚晒NaviX Ultra蓝境配色真机图

艺术要闻

《步辇图》最大骗局:全程没有文成公主,却骗了所有中国人 1300 年

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版