网易首页 > 网易号 > 正文 申请入驻

万分之一——大模型后训练中的极端稀疏监督

0
分享至





  • 论文标题:Extremely Sparse Supervision Incentivizes Reasoning Ability
  • 论文链接:https://arxiv.org/abs/2609.04565
  • X Post:https://x.com/iampanxu/status/2099151119658475880?s=20
  • image



后训练是提高大模型推理能力的关键一环,一次后训练至少包含了上亿个 token 的梯度信号。以数学推理为例,大模型的一条 rollout 通常包含几千个 token,如果只保留其中一个 token 处的梯度信号做参数更新,训练会崩溃吗?

亚马逊公司和杜克大学的一项最新研究表明,在这种极端稀疏的梯度信号下,训练不但没有失败,反而取得了更好的推理性能。这项研究对一个被默认且普遍接受的假设提出了挑战:大模型后训练中密集的 token-level 信号真的是必要的吗?



一个 token 所包含的丰富信息


On-Policy Distillation(OPD,在线策略蒸馏)是近期在业界和学术界中备受关注的后训练范式,在前沿大模型训练中已成为提升模型能力和实现高效能力迁移的重要技术路径。OPD 天然具有密集的 token-level 监督信号:学生模型生成推理轨迹,教师模型对轨迹中的每一个 token 提供反馈。这种密集的 token-level 监督信号一直以来被认为是 OPD 取得成功的重要特点,但也增加了理解 OPD 内在机制的难度。



研究团队以 OPD 和数学推理为起始研究场景,做了一个极端的实验:对于学生模型生成的每一条 rollout,仅随机保留一个 token 处的梯度,使其参与参数更新,同时 mask 掉其他所有 token 处的信号。换句话说,如果一条 rollout 包含了 4000 个 token,那么只有 0.025% 的 token 得到了教师模型的监督信号。实验结果出人意料:在如此极端的稀疏信号下,学生模型的推理能力依然得到显著提升。

研究团队基于 Qwen3 系列构造了9 组不同的教师—学生配置,涵盖:

1)小参数量学生模型蒸馏大参数量教师模型;

2)同等规模的教师模型和学生模型;

3)大参数量学生模型蒸馏小参数量教师模型。

不同的设置代表了教师模型与学生模型之间不同程度的表征差异。在所有组合中,随机监督一个 token,都能一致地观察到学生模型推理性能的提升。

极端稀疏的监督信号,胜过密集监督

在这种极端稀疏监督的训练模式下,学生模型推理能力的提升能否进一步扩大?这涉及监督信号的选择。在 OPD 中,每一个 token 的监督信号代表了教师模型和学生模型在该 token 处的分歧度,研究团队选择保留每一条 rollout 中分歧最大的 token。实验结果表明,仅仅一到两个 token 的监督信号可以匹配甚至超过全信号训练。



Math Reasoning OPD: Qwen3-8B student ← Qwen3-4B-Instruct-2507 teacher

如上的实验结果更是显示,监督一个或者两个 token 所得到的学生模型不仅比全信号训练得到的学生模型好,更是超过了教师模型本身。另一个有趣的观察是,尽管标准 OPD 的目标是缩小学生模型与教师模型输出分布之间的差异,但在极端稀疏监督下,推理性能最强的学生模型,其输出分布与教师模型之间的差异不仅没有缩小,反而可能进一步增大。这暗示了在极端稀疏监督的训练范式下,学生并非单纯通过模仿教师模型获得推理性能的提升。

为了进一步研究这一现象的泛化性,研究团队进行了跨任务、跨模型系列和跨后训练范式的验证,将实验拓展到了:1)代码推理任务;2)Llama 系列模型;以及 3)基于 Proximal Policy Optimization(PPO)的 Reinforcement Learning with Verifiable Reward(RLVR)。不出意料地,在这些场景下的实验结果均展现了同样的现象:极端稀疏的监督信号足以非常有效地提升模型的推理能力。



Coding Reasoning OPD: Qwen3-4B student ← Qwen3-30B-A3B-Instruct-2507 teacher

剖析极端稀疏监督背后的机制

这项工作给出了一个值得关注的数据点:一次成功的后训练,可能只需要利用几千个 token 处的梯度。在这一尺度下,研究者可以直接观察被激活 token 所承载的语义信息,以及它们对学习动力学的影响。下表展示了一些被激活且获得正奖励(教师模型希望其概率增大)的 token。



此外,研究团队利用消融试验得到了一些有趣的结论:

1)模型推理性能的提升与监督信号的稠密程度并非单调关系:随着受监督 token 的数量逐渐减少,模型推理性能起初会有所下降,但随后又会恢复;当监督变得极端稀疏时,性能甚至可以超过全信号训练。然而,当监督进一步稀疏到一定程度后,学习信号最终会变得不足,无法再带来有意义的推理性能提升。

2)OPD 实验中,当学生模型具有足够的表征能力,带正奖励的 token 可以更好地激发学生的推理能力;而当学生模型表征能力弱于教师模型时,带负奖励的 token 取得更好的训练效果。

3)极端稀疏监督也带来了更加稀疏的神经网络参数更新,万分之一的监督信号仅仅更新了 10% 的网络参数,即可取得大幅的推理性能提升。

最后,为什么一个 token 的监督信号就能如此有效?这仍然是一个开放的问题。研究团队给出了一个类比:极端稀疏监督更像是人类的自然学习过程。当人们带着一定先验知识和基础能力去学习一项复杂任务时,往往并不需要细粒度的反馈,少量但关键的纠正信号就可能显著改变后续的行为与策略。类似地,一个经过预训练、SFT 和 RL 的大模型本身已经具备了一定的推理能力;当进一步对其进行后训练时,可能并不需要覆盖每一个 token 的密集监督,少量但关键的学习信号便足以引导模型进一步调整,并带来显著的推理性能提升。

作者简介:Zhishuai Liu 是杜克大学(Duke University)的博士生,导师为 Prof. Pan Xu。本文宣传的工作是其在亚马逊(Amazon)公司实习期间完成。Dr. Xingzi Xu 和 Dr. Mehmet Saygin Seyfioglu 是亚马逊公司的 Applied Scientist,Dr. Karim Bouyarmane 是亚马逊公司的 Senior Manager。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
28岁实验员打碎病原体试管后离世,近200人隔离,鼠疫疑云再起

28岁实验员打碎病原体试管后离世,近200人隔离,鼠疫疑云再起

庄时利和
2026-10-07 13:41:12
不男不女,娘性文化?人民日报“点名”周深,身份地位回不去了

不男不女,娘性文化?人民日报“点名”周深,身份地位回不去了

不似少年游
2026-10-07 09:32:51
俄疑发生鼠疫,美国驻俄使馆发布警告:在俄公民立即离开

俄疑发生鼠疫,美国驻俄使馆发布警告:在俄公民立即离开

爆角追踪
2026-10-07 12:50:26
又一品牌“切割”:对于蔡康永不当行为强烈震惊、坚决反对,下架全部相关合作内容

又一品牌“切割”:对于蔡康永不当行为强烈震惊、坚决反对,下架全部相关合作内容

第一财经资讯
2026-10-06 21:46:02
41岁高中教师突发心梗离世,妻子:出事当天他原本准备去家访,还特意早起理了发;女儿发文缅怀父亲:最后一课,学会接受离别

41岁高中教师突发心梗离世,妻子:出事当天他原本准备去家访,还特意早起理了发;女儿发文缅怀父亲:最后一课,学会接受离别

都市快报橙柿互动
2026-10-07 19:46:41
国庆高速数据彻底打脸!油电大势已定,再也回不去了

国庆高速数据彻底打脸!油电大势已定,再也回不去了

华庭讲美食
2026-10-06 02:59:29
央视曝光全是假的!88元“进口奶粉”,成本才2块钱,电商都在售

央视曝光全是假的!88元“进口奶粉”,成本才2块钱,电商都在售

听风喃
2026-10-06 18:39:29
缅北木姐地图上密密麻麻红点全是电诈窝点,警方:2024年抓获807人,拔掉最后一颗“钉子”,真正意义完成对缅北四个方向电诈窝点全面清剿

缅北木姐地图上密密麻麻红点全是电诈窝点,警方:2024年抓获807人,拔掉最后一颗“钉子”,真正意义完成对缅北四个方向电诈窝点全面清剿

扬子晚报
2026-10-07 16:11:40
丰田新车官图正式发布,10月7日,即将上市

丰田新车官图正式发布,10月7日,即将上市

科技堡垒
2026-10-07 15:42:24
大家一定要提前准备,按当前趋势,10月开始国内或将迎来三大转变

大家一定要提前准备,按当前趋势,10月开始国内或将迎来三大转变

童童聊娱乐啊
2026-10-06 01:52:44
《人生七年》70岁终章!14个英国孩子的结局,给今天的中国父母狠狠上了一课...

《人生七年》70岁终章!14个英国孩子的结局,给今天的中国父母狠狠上了一课...

阅读第一
2026-10-05 08:35:09
孙颖莎,遗憾出局!WTT中国大满贯:莎莎苦战4局,1-3输给帕拉南

孙颖莎,遗憾出局!WTT中国大满贯:莎莎苦战4局,1-3输给帕拉南

足球评论大家谈
2026-10-07 19:57:39
为什么一定要拼尽全力考上985、211?不是为了高人一等,是为了以后不用向生活低头

为什么一定要拼尽全力考上985、211?不是为了高人一等,是为了以后不用向生活低头

好爸育儿
2026-10-07 11:07:25
一场0-2大爆冷,3号种子高芙翻车,郑钦文双喜临门,迎冲冠良机!

一场0-2大爆冷,3号种子高芙翻车,郑钦文双喜临门,迎冲冠良机!

大秦壁虎白话体育
2026-10-07 16:57:45
大结局!东航“最霸气”乘客欧某某,这次终于踢到铁板了,真容曝光,全网社死

大结局!东航“最霸气”乘客欧某某,这次终于踢到铁板了,真容曝光,全网社死

静若梨花
2026-10-06 14:15:09
上海一家三口长假爬山,下山走野路结果被困,“当时真绝望了,什么都看不见,我还带着老婆、10岁的孩子……”国庆前刚有人在此失足坠崖

上海一家三口长假爬山,下山走野路结果被困,“当时真绝望了,什么都看不见,我还带着老婆、10岁的孩子……”国庆前刚有人在此失足坠崖

都市快报橙柿互动
2026-10-07 17:37:20
演员王星案详细案情披露,被骗至妙瓦底4天内被转卖3次,在曼谷发现危险向女友发出求救暗号

演员王星案详细案情披露,被骗至妙瓦底4天内被转卖3次,在曼谷发现危险向女友发出求救暗号

政知新媒体
2026-10-07 15:00:31
6-1到2-6!郑钦文再现收视率打法,晋级中网8强有变,对手打疯了

6-1到2-6!郑钦文再现收视率打法,晋级中网8强有变,对手打疯了

侃球熊弟
2026-10-07 19:48:44
对手超神了!孙颖莎1-3帕拉南无缘晋级中国大满贯16强!

对手超神了!孙颖莎1-3帕拉南无缘晋级中国大满贯16强!

篮球资讯达人
2026-10-07 19:59:23
刚刚,95岁化学家拿下诺奖!这个奖,他等了整整25年

刚刚,95岁化学家拿下诺奖!这个奖,他等了整整25年

智药局
2026-10-07 18:26:33
2026-10-07 21:00:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14143文章数 142744关注度
往期回顾 全部

科技要闻

诺贝尔化学奖揭晓,两位科学家摘得大奖

头条要闻

缅北木姐地图上密密麻麻全是电诈窝点 中方跨境"拔钉"

头条要闻

缅北木姐地图上密密麻麻全是电诈窝点 中方跨境"拔钉"

体育要闻

从骑马舞到开口全中文 德约在北京不止七冠

娱乐要闻

蔡康永风波再升级!这次谁也救不了他

财经要闻

谷歌签下科技史上最大核能协议

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

手机
教育
数码
本地
公开课

手机要闻

华为自研Wi-Fi 7+芯片级协同技术支持设备上新,新增Mate 90系列手机

教育要闻

长假结束孩子又不去上学了,该如何让他把复学坚持下去?

数码要闻

准系统6689元:铭凡MS-03迷你主机酷睿Ultra 9 386H版本开售

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版