网易首页 > 网易号 > 正文 申请入驻

万分之一——大模型后训练中的极端稀疏监督

0
分享至





  • 论文标题:Extremely Sparse Supervision Incentivizes Reasoning Ability
  • 论文链接:https://arxiv.org/abs/2609.04565
  • X Post:https://x.com/iampanxu/status/2099151119658475880?s=20
  • image



后训练是提高大模型推理能力的关键一环,一次后训练至少包含了上亿个 token 的梯度信号。以数学推理为例,大模型的一条 rollout 通常包含几千个 token,如果只保留其中一个 token 处的梯度信号做参数更新,训练会崩溃吗?

亚马逊公司和杜克大学的一项最新研究表明,在这种极端稀疏的梯度信号下,训练不但没有失败,反而取得了更好的推理性能。这项研究对一个被默认且普遍接受的假设提出了挑战:大模型后训练中密集的 token-level 信号真的是必要的吗?



一个 token 所包含的丰富信息


On-Policy Distillation(OPD,在线策略蒸馏)是近期在业界和学术界中备受关注的后训练范式,在前沿大模型训练中已成为提升模型能力和实现高效能力迁移的重要技术路径。OPD 天然具有密集的 token-level 监督信号:学生模型生成推理轨迹,教师模型对轨迹中的每一个 token 提供反馈。这种密集的 token-level 监督信号一直以来被认为是 OPD 取得成功的重要特点,但也增加了理解 OPD 内在机制的难度。



研究团队以 OPD 和数学推理为起始研究场景,做了一个极端的实验:对于学生模型生成的每一条 rollout,仅随机保留一个 token 处的梯度,使其参与参数更新,同时 mask 掉其他所有 token 处的信号。换句话说,如果一条 rollout 包含了 4000 个 token,那么只有 0.025% 的 token 得到了教师模型的监督信号。实验结果出人意料:在如此极端的稀疏信号下,学生模型的推理能力依然得到显著提升。

研究团队基于 Qwen3 系列构造了9 组不同的教师—学生配置,涵盖:

1)小参数量学生模型蒸馏大参数量教师模型;

2)同等规模的教师模型和学生模型;

3)大参数量学生模型蒸馏小参数量教师模型。

不同的设置代表了教师模型与学生模型之间不同程度的表征差异。在所有组合中,随机监督一个 token,都能一致地观察到学生模型推理性能的提升。

极端稀疏的监督信号,胜过密集监督

在这种极端稀疏监督的训练模式下,学生模型推理能力的提升能否进一步扩大?这涉及监督信号的选择。在 OPD 中,每一个 token 的监督信号代表了教师模型和学生模型在该 token 处的分歧度,研究团队选择保留每一条 rollout 中分歧最大的 token。实验结果表明,仅仅一到两个 token 的监督信号可以匹配甚至超过全信号训练。



Math Reasoning OPD: Qwen3-8B student ← Qwen3-4B-Instruct-2507 teacher

如上的实验结果更是显示,监督一个或者两个 token 所得到的学生模型不仅比全信号训练得到的学生模型好,更是超过了教师模型本身。另一个有趣的观察是,尽管标准 OPD 的目标是缩小学生模型与教师模型输出分布之间的差异,但在极端稀疏监督下,推理性能最强的学生模型,其输出分布与教师模型之间的差异不仅没有缩小,反而可能进一步增大。这暗示了在极端稀疏监督的训练范式下,学生并非单纯通过模仿教师模型获得推理性能的提升。

为了进一步研究这一现象的泛化性,研究团队进行了跨任务、跨模型系列和跨后训练范式的验证,将实验拓展到了:1)代码推理任务;2)Llama 系列模型;以及 3)基于 Proximal Policy Optimization(PPO)的 Reinforcement Learning with Verifiable Reward(RLVR)。不出意料地,在这些场景下的实验结果均展现了同样的现象:极端稀疏的监督信号足以非常有效地提升模型的推理能力。



Coding Reasoning OPD: Qwen3-4B student ← Qwen3-30B-A3B-Instruct-2507 teacher

剖析极端稀疏监督背后的机制

这项工作给出了一个值得关注的数据点:一次成功的后训练,可能只需要利用几千个 token 处的梯度。在这一尺度下,研究者可以直接观察被激活 token 所承载的语义信息,以及它们对学习动力学的影响。下表展示了一些被激活且获得正奖励(教师模型希望其概率增大)的 token。



此外,研究团队利用消融试验得到了一些有趣的结论:

1)模型推理性能的提升与监督信号的稠密程度并非单调关系:随着受监督 token 的数量逐渐减少,模型推理性能起初会有所下降,但随后又会恢复;当监督变得极端稀疏时,性能甚至可以超过全信号训练。然而,当监督进一步稀疏到一定程度后,学习信号最终会变得不足,无法再带来有意义的推理性能提升。

2)OPD 实验中,当学生模型具有足够的表征能力,带正奖励的 token 可以更好地激发学生的推理能力;而当学生模型表征能力弱于教师模型时,带负奖励的 token 取得更好的训练效果。

3)极端稀疏监督也带来了更加稀疏的神经网络参数更新,万分之一的监督信号仅仅更新了 10% 的网络参数,即可取得大幅的推理性能提升。

最后,为什么一个 token 的监督信号就能如此有效?这仍然是一个开放的问题。研究团队给出了一个类比:极端稀疏监督更像是人类的自然学习过程。当人们带着一定先验知识和基础能力去学习一项复杂任务时,往往并不需要细粒度的反馈,少量但关键的纠正信号就可能显著改变后续的行为与策略。类似地,一个经过预训练、SFT 和 RL 的大模型本身已经具备了一定的推理能力;当进一步对其进行后训练时,可能并不需要覆盖每一个 token 的密集监督,少量但关键的学习信号便足以引导模型进一步调整,并带来显著的推理性能提升。

作者简介:Zhishuai Liu 是杜克大学(Duke University)的博士生,导师为 Prof. Pan Xu。本文宣传的工作是其在亚马逊(Amazon)公司实习期间完成。Dr. Xingzi Xu 和 Dr. Mehmet Saygin Seyfioglu 是亚马逊公司的 Applied Scientist,Dr. Karim Bouyarmane 是亚马逊公司的 Senior Manager。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中国大满贯女单爆冷:石洵瑶双零封,王曼昱16强内战

中国大满贯女单爆冷:石洵瑶双零封,王曼昱16强内战

烟浔渺渺
2026-10-07 18:30:00
53岁男子性交易前猝死

53岁男子性交易前猝死

张晓磊
2026-10-07 11:46:16
托卡耶夫没有把话挑明,但他给了足够的暗示:要是俄罗斯总统不是普京坐镇,对欧洲来说才是真正的大麻烦

托卡耶夫没有把话挑明,但他给了足够的暗示:要是俄罗斯总统不是普京坐镇,对欧洲来说才是真正的大麻烦

人生录
2026-10-06 21:15:34
俄鼠疫实验室出事,美方发出警告,病原体一旦外泄或将快速扩散

俄鼠疫实验室出事,美方发出警告,病原体一旦外泄或将快速扩散

泪之魂y
2026-10-06 14:42:34
红军长征饮食真相:打破“草根树皮”传说,还原当年真实丰富伙食

红军长征饮食真相:打破“草根树皮”传说,还原当年真实丰富伙食

小豫讲故事
2026-10-05 06:00:40
梁朝伟怎么看上她的?刘嘉玲户外跑步遇大雨,全素颜出镜变老大妈

梁朝伟怎么看上她的?刘嘉玲户外跑步遇大雨,全素颜出镜变老大妈

八星人
2026-10-06 16:17:22
中国电网负债3万亿,外媒称百年难回本

中国电网负债3万亿,外媒称百年难回本

梦想的现实
2026-07-01 01:11:56
梅西感人致辞:世界杯之后该说再见了,真希望一辈子为国家队出场

梅西感人致辞:世界杯之后该说再见了,真希望一辈子为国家队出场

奥拜尔
2026-10-07 10:17:32
天气转凉,糖尿病人注意:晚餐宁可吃面,也不要随便吃这8物

天气转凉,糖尿病人注意:晚餐宁可吃面,也不要随便吃这8物

健康科普365
2026-10-06 14:45:09
确认了!印度要申办奥运会!

确认了!印度要申办奥运会!

五星体育
2026-10-07 16:21:43
C罗,撂挑子了?

C罗,撂挑子了?

中国新闻周刊
2026-10-07 11:54:09
假如被劫的那架飞机上是中国人

假如被劫的那架飞机上是中国人

二湘空间
2026-10-07 07:50:03
广州高校排名出现调整!广东工业第 4,广东财大第 7,白云学院民办第 3

广州高校排名出现调整!广东工业第 4,广东财大第 7,白云学院民办第 3

辉哥说动漫
2026-10-07 09:33:20
国庆即将结束,没想到最热门城市,不是成都,不是重庆,它最意外

国庆即将结束,没想到最热门城市,不是成都,不是重庆,它最意外

阅微札记
2026-10-07 14:28:25
哈里梅根终于低头,为奥普拉采访道歉,王室反应曝光:威廉没理

哈里梅根终于低头,为奥普拉采访道歉,王室反应曝光:威廉没理

手工制作阿歼
2026-10-07 17:52:46
1700枚航空炸弹,4天炸穿基辅大桥!乌克兰:别打了,我想停火

1700枚航空炸弹,4天炸穿基辅大桥!乌克兰:别打了,我想停火

北海史记
2026-10-06 11:42:48
3线全胜!就在刚刚,WTT中国大满贯爆大冷:22岁陈熠闪耀全场,3-1掀翻国乒克星!女队火力全开,5人挺进16强

3线全胜!就在刚刚,WTT中国大满贯爆大冷:22岁陈熠闪耀全场,3-1掀翻国乒克星!女队火力全开,5人挺进16强

篮球热嗖
2026-10-07 18:15:45
东航空姐被逼下跪反转!知情人曝猛料,不是故意刁难,真相不简单

东航空姐被逼下跪反转!知情人曝猛料,不是故意刁难,真相不简单

橘仔看世界
2026-10-06 19:35:36
不顾央视警告顶风作案,28 岁赵露思又曝猛料,表姐婚礼 “丑态百出”

不顾央视警告顶风作案,28 岁赵露思又曝猛料,表姐婚礼 “丑态百出”

搞笑娱乐笑话
2026-10-06 11:24:21
长春市委书记到火车站,迎接冠军

长春市委书记到火车站,迎接冠军

极目新闻
2026-10-07 11:38:15
2026-10-07 19:40:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14143文章数 142744关注度
往期回顾 全部

科技要闻

诺贝尔化学奖揭晓,两位科学家摘得大奖

头条要闻

男子带妻子和10岁娃爬山走野路 用手机照亮半夜没走出

头条要闻

男子带妻子和10岁娃爬山走野路 用手机照亮半夜没走出

体育要闻

从骑马舞到开口全中文 德约在北京不止七冠

娱乐要闻

蔡康永风波再升级!这次谁也救不了他

财经要闻

谷歌签下科技史上最大核能协议

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

手机
数码
旅游
本地
公开课

手机要闻

还得是苹果!iPhone Duo 强制 APP 适配,不适配直接下架,安卓办不到

数码要闻

苹果Apple TV平台F1赛事转播将支持杜比全景声,本月底上线

旅游要闻

【图集】甲秀楼游人如织 文明相伴景更美

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版