网易首页 > 网易号 > 正文 申请入驻

美国RLHF权威学者发长文科普:Fable 5 不可能蒸馏出K3!

0
分享至

“对于 Kimi K3 和 GLM-5.2 这样的模型,从时间线来看,Fable 5 很可能没有作为它们的蒸馏教师模型产生影响。”

开源大模型领军人物 Nathan Lambert 在 X 上发帖说。


Nathan Lambert 是全球顶尖大模型后训练、RLHF(人类反馈强化学习)权威学者。

他应该是看不下去 针对 K3 的一堆胡乱指责,写了篇关于蒸馏的小作文进行科普。

Nathan Lambert 说,即使 K3 使用了 Claude 等前沿模型生成的数据,这更可能发生在 SFT(监督微调)阶段,用于帮助模型学习推理模式,而不是简单“复制”一个美国顶级模型的能力。

“蒸馏确实可能被使用了,但大家高估了它对最终模型能力的影响。”他分析称,蒸馏最多只是模型训练早期的助推器。

从初始 SFT 数据,到达到 Kimi K3、GLM-5.2 这样的性能水平,中间仍需要大量的数据筛选、强化学习、训练策略优化等复杂过程。真正决定模型上限的,是后训练体系和工程能力,而非是否拥有某个强大的“教师模型”。

他直接发推指出,“中国实验室在 RL 期间并没有使用 Fable / 最强的模型作为教师,那不是蒸馏的工作方式”。

Nathan Lambert还无奈的说,“对于那些指责我在蒸馏问题上充当中国水军的人,我想说:我很早以前就一直担心这个问题。如今,我们才刚刚开始感受到在开放模型领域落后的代价。如果美国不想办法支持本土开放模型的发展,未来情况只会变得更加糟糕。”

以下为博文全文——

我目前对于蒸馏技术的使用方式,以及它究竟能带来多少性能提升的一些看法。

先说明背景:Anthropic 确实曾表示,DeepSeek 等模型正在使用他们的模型参与一种基于强化学习(RL)的数据生成流程,但这并不意味着这种方式带来了显著的性能提升。

这些案例中的样本数量非常少,很可能只是用于初始化一个内部模型,或者进行小规模训练实验。

真正将蒸馏作为关键步骤使用的阶段,是 SFT(监督微调)和/或中期训练(midtraining)阶段(把 SFT 和 midtraining 完全分开来看其实并不合理,因为两者在培养模型推理行为方面存在连续性)。

这也是为什么一些中国模型在输出时会出现“I’m Claude(我是 Claude)”之类的行为。

原因在于,在进行下一词预测(next-token prediction)训练时,模型会学习一些“特征”(features),这些特征实际上是由大量 token 聚类形成的模式,并且会经常出现在模型输出中。

这种 SFT 数据通常是通过绕过 API 原本设计的行为限制,获取模型的推理过程 token(reasoning tokens)生成的。

如果不能直接获得模型的推理token,那么这些数据会非常难以用于训练,而且很可能不会包含类似“我是 Claude”这样的行为模式。

目前,高质量 SFT 数据集的规模通常在 百万级提示词(约 O(1 million prompts)),并配套高质量回答。如今,获取这些提示词往往才是最困难的部分——尤其是那些经过精心设计、未来可以用于强化学习(RL)的环境型任务提示。不过,这更多影响的是 SFT 阶段。

说到底,SFT 蒸馏真正可能发挥巨大作用的地方,是当模型进入一个新的专业领域时。

一个很好的例子是 CripPT 物理基准测试,在这个领域,美国实验室目前领先很多。

理论上,可以获取一些专业领域的问题提示,然后让一个前沿模型生成答案,用这些数据作为新模型初始 SFT 的训练材料。

但是,即便拥有了一套初始 SFT 数据,要让一个模型达到 GLM 5.2 和 Kimi K3 这样的性能水平,仍然需要大量工作。


SFT 阶段只是构建后训练(post-training)体系的开始,后续还有一个漫长且艰苦的过程,包括:


  • 生成更多 SFT 数据;
  • 对数据进行筛选(类似 rejection sampling,拒绝采样);
  • 通过大规模强化学习不断优化模型行为。

对于 Kimi K3 和 GLM-5.2 这样的模型,从时间线来看,Fable 5 很可能没有作为它们的蒸馏教师模型产生影响。不过,未来模型可能会从 Fable 5 这类前沿模型中获益。

而随着后训练越来越依赖诸如 多教师在线策略蒸馏(multi-teacher on-policy distillation) 等技术,而不仅仅是强化学习,SFT 蒸馏究竟如何影响最终模型,变得更加复杂。

整个过程包含很多环节,而且强化学习已经在最终模型能力中占据越来越重要的比例。

这里最关键的一点是:在上述 SFT 阶段,最强的教师模型通常并不是最容易被整合进后训练流程的模型。

例如,目前领先的完全开放推理模型 SFT 项目——如 Open Thoughts 和 OLMo——在尝试更新训练流程、使用最强模型作为教师时,都遇到了很大困难。

很多时候,真正优秀的教师模型反而是一些规模更小、出人意料的模型。

这意味着,推动蒸馏进步的可能并不一定是最顶尖的闭源模型!整个过程非常复杂。

综合来看,目前关于后训练阶段的证据表明,蒸馏的重要性正在下降。

过去,在强化学习尚未大规模应用之前,蒸馏的重要性更高,因为在基础模型(base model)之上,通过 SFT 获得的性能提升占最终能力的比例更大。

但随着 RL 规模扩大,这种趋势正在改变。我认为这一趋势还会持续,尤其是在开放权重模型(open-weight models)越来越强的情况下。

同时,教师模型存在的不确定性,也削弱了一种常见观点——即开放模型只是通过“蒸馏洗白”(distillation washing)获得能力。

因为如果必须依赖 Claude 或 GPT 的 API 才能实现蒸馏,那么开放模型的发展空间会受到限制。

但现实可能恰恰相反,开放模型可能本身更容易被蒸馏,因为它们更容易修改、更容易实验、更方便研究人员进行调整和迭代。

这才是目前蒸馏竞争格局中更值得关注的方向。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
广西女子洪水中被毒蛇咬伤身亡,蛇场只愿给2万元补偿,因无法证明毒蛇来源,警方未立案,家属欲起诉!律师:非法养殖不能因洪水免责

广西女子洪水中被毒蛇咬伤身亡,蛇场只愿给2万元补偿,因无法证明毒蛇来源,警方未立案,家属欲起诉!律师:非法养殖不能因洪水免责

都市快报橙柿互动
2026-09-12 09:05:28
上海7岁女童放学途中遭搅拌车辗轧双腿高位截肢,奶奶当场死亡,家属:事故车案发前多次超载,涉事企业应负刑责;公司负责人:愿尽力赔付

上海7岁女童放学途中遭搅拌车辗轧双腿高位截肢,奶奶当场死亡,家属:事故车案发前多次超载,涉事企业应负刑责;公司负责人:愿尽力赔付

台州交通广播
2026-09-12 09:38:02
“鬼王”雷宇扬因胃癌去世终年62岁,小21岁妻子证实,曾主演《阴阳路》

“鬼王”雷宇扬因胃癌去世终年62岁,小21岁妻子证实,曾主演《阴阳路》

开开森森
2026-09-11 16:11:26
别再把锅丢给张子宇!真正拖垮女篮的,是这个首发位置的长期隐身

别再把锅丢给张子宇!真正拖垮女篮的,是这个首发位置的长期隐身

林子说事
2026-09-12 00:21:46
美网621万奖金!扣完税后,郑钦文真正到手多少?直接缩水了一半

美网621万奖金!扣完税后,郑钦文真正到手多少?直接缩水了一半

侃球熊弟
2026-09-12 08:00:37
婚后第一辆车,老婆一坐上去就发现不对劲!浙江夫妻俩当场傻眼:等了几个小时,问题始终没有解决 ,还没开出4S店就想退车…

婚后第一辆车,老婆一坐上去就发现不对劲!浙江夫妻俩当场傻眼:等了几个小时,问题始终没有解决 ,还没开出4S店就想退车…

台州交通广播
2026-09-12 09:38:15
退役已6年!39岁广州旧将正式复出 曾花恒大3.3亿+创中国足球纪录

退役已6年!39岁广州旧将正式复出 曾花恒大3.3亿+创中国足球纪录

我爱英超
2026-09-12 07:13:02
美职联出现诡异点球,没碰框也没碰网,只在网内停了0.1秒

美职联出现诡异点球,没碰框也没碰网,只在网内停了0.1秒

懂球帝
2026-09-12 02:38:15
宜宾一镇干部否认推女子入厕强奸,警方复核称“有犯罪事实”

宜宾一镇干部否认推女子入厕强奸,警方复核称“有犯罪事实”

澎湃新闻
2026-09-12 07:46:26
反转!长沙“摸腚姐”遭舆论审判,社交媒体被扒、警方二次介入!

反转!长沙“摸腚姐”遭舆论审判,社交媒体被扒、警方二次介入!

天天热点见闻
2026-09-12 06:43:45
重磅!中国宣布对日本人签证费大涨7.5倍!中日这场“对等博弈”,普通人看懂这几点就够了

重磅!中国宣布对日本人签证费大涨7.5倍!中日这场“对等博弈”,普通人看懂这几点就够了

东京在线
2026-09-11 23:08:59
施顺华,被查

施顺华,被查

新京报政事儿
2026-09-11 17:34:05
大快人心!被摸臀女子再遇麻烦,马来亚大学表态,留学退路或断送

大快人心!被摸臀女子再遇麻烦,马来亚大学表态,留学退路或断送

史之韵
2026-09-11 19:38:40
社死名场面啊!一件裙子把女明星的“小肚子”逼上热搜,强光一打,她吓得死死捂着肚子,满脸写着尴尬,真相流出

社死名场面啊!一件裙子把女明星的“小肚子”逼上热搜,强光一打,她吓得死死捂着肚子,满脸写着尴尬,真相流出

火山詩话
2026-09-11 10:01:05
4轮轰16球!西汉姆先赛登顶,6-0平35年来联赛最大赢球纪录

4轮轰16球!西汉姆先赛登顶,6-0平35年来联赛最大赢球纪录

懂球帝
2026-09-12 05:49:07
罗杰斯:丢掉这2分让我们很难过,对手利用了我们的失误

罗杰斯:丢掉这2分让我们很难过,对手利用了我们的失误

懂球帝
2026-09-12 05:39:08
iPhone Duo开合动画被「抄」遍全网:安卓能做、MacBook也能做,门槛这么低?

iPhone Duo开合动画被「抄」遍全网:安卓能做、MacBook也能做,门槛这么低?

泡泡网
2026-09-11 16:53:23
普京时代或将落幕,中方有必要警惕俄罗斯转向!

普京时代或将落幕,中方有必要警惕俄罗斯转向!

律法刑道
2026-09-11 10:06:21
胖东来新乡撤场后租金跌至400万,为何成了“谁碰谁死”的陷阱?

胖东来新乡撤场后租金跌至400万,为何成了“谁碰谁死”的陷阱?

爱看剧的阿峰
2026-09-11 01:28:31
乌情报局长捅破窗户纸:俄军每天死的人比招的人还多,2028年就是终点

乌情报局长捅破窗户纸:俄军每天死的人比招的人还多,2028年就是终点

民间马后炮
2026-09-12 01:29:41
2026-09-12 11:19:00
AI先锋官 incentive-icons
AI先锋官
AIGC大模型及应用精选与评测
668文章数 104关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

iPhone Duo百万人预约被黄牛炒到9万元 网友:太疯狂

头条要闻

iPhone Duo百万人预约被黄牛炒到9万元 网友:太疯狂

体育要闻

老鹰真正的底气来自于什么?

娱乐要闻

港媒曝钟丽淇疑患渐冻症,本人发文

财经要闻

继房子茅台之后 中产的第"神话"也破灭了

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

本地
时尚
手机
公开课
军事航空

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

女友BELLA+封面 | Fort&Peat:长日无尽

手机要闻

三星向Tim Cook赠送Galaxy Z Fold 8 并幽默喊话“欢迎入场”

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

涉伊朗核问题 中国和俄罗斯投下反对票

无障碍浏览 进入关怀版