网易首页 > 网易号 > 正文 申请入驻

Meta AI技术负责人:关于蒸馏的五个误区

0
分享至


我最近看到 X 上关于 AI 蒸馏(Distillation)流传着不少误解。

这些观点通常来自两个阵营:一方把它描述成一场“模型劫案”,另一方则认为“根本没什么值得关注的”。

我这里不对任何一方的具体行为发表评论,只是纠正一些关于蒸馏的常见误区。

误区一:“蒸馏就是偷走一个模型”

蒸馏是一种训练方法。

在大语言模型(LLM)领域,学生模型(student)可以从教师模型(teacher)的回答、token 概率、排序结果、偏好信息或判断结果中学习。

这种机制可以用于同一家实验室内部、不同机构之间基于授权或合同合作,以及未经授权的情况下使用。

蒸馏技术已经存在十多年,最初被广泛用于将大型系统的能力压缩到更小、更便宜的模型中。

如今,各大实验室都会使用蒸馏以及相关的合成数据技术,来构建成本更低或更专业化的 AI 模型。

还有一个更微妙的现实是,随着越来越多互联网内容由 AI 生成或编辑,新一代模型越来越多地训练于上一代模型产生的输出之上。

这严格来说并不属于技术意义上的“知识蒸馏”(knowledge distillation),但它确实形成了一种广泛存在的“模型之间能力迁移”,即使没有明确的教师-学生训练流程。

因此,“蒸馏”只能说明能力可能通过某种方式发生了转移。

它本身并不能证明是否有人进行了模型窃取。

误区二:“几百万次对话太少,不可能产生影响”

单纯从数据量来看,一些蒸馏行为确实看起来规模太小,似乎不足以产生影响。

假设每次对话包含 1000~4000 个 token、1600 万次对话,那么总量大约是160 亿~640 亿 token。

相比公开资料中的前沿模型训练规模,例如 Llama 3 405B 使用超过 15 万亿 token,这只占约 0.1%~0.4%。

但训练过程并不是把所有数据均匀混合在一起的一锅“汤”。

小规模数据在某些阶段可能拥有极高杠杆作用。

第一,后期训练阶段

在退火(annealing)阶段以及针对性的中期训练阶段,部分数据会被刻意提高权重,而不是简单均匀混入整个训练过程。

例如,在 Meta 对 Llama 3 的数据质量实验中一个 8B 模型进行了 400 亿 token 的退火训练,其中候选高质量数据占训练混合比例的 30%。

Meta 报告显示, GSM8K 数学测试提升 24.0%,MATH 测试提升 6.4%。

不过,在 405B 大模型上,收益几乎可以忽略。

这说明小规模高质量数据确实可能有效,但这种效果并不会随着模型规模线性扩大。

第二,强化学习启动阶段(RL bootstrapping)

DeepSeek-R1 在第一次面向推理能力的强化学习阶段之前,使用了数千条冷启动样本。

但简单说“强化学习完成了一切”是不准确的。

完整流程后来还加入约 80 万条监督微调样本,及另一阶段强化学习。

同时,它的伴随模型 R1-Zero 展示了即使没有监督冷启动数据,仅靠强化学习,也可以涌现出较强推理能力。

第三,训练评估器(judge)

教师模型并不一定直接提供训练文本。

它可以给答案打分、对多个答案排序,及评价网页质量。

这些标签随后可以训练奖励模型、分类器、数据过滤器。

这些系统又会影响规模大得多的数据。

也就是说,迁移的不一定是文本,而可能是判断标准、偏好和品味。

所以现实情况是,小规模数据如果处于正确的位置,可能成为整个训练流程中的关键变量。

误区三:“从模型输出可以看出来,学生模型会暴露教师模型”

这一点很难成立。

一些明显证据,例如模型直接说“我是某某公司的模型”,在经过改写、混合、转换成评分信号之后,很容易消失。

一个成熟的训练流程可能会先用本地模型重新表达教师模型回答,将数据稀释到更大的混合数据集中,或者只把教师模型用于评分,而完全不保留原始文本。

目前我也没有看到任何已经在生产环境部署、并且被证明能够在完整训练流程中存活的模型输出水印技术。

误区四:“他们正在用大量采集的模型输出填充训练数据”

预训练数据规模通常是万亿 token 级别。万亿 token 规模的合成数据集,通常不是通过调用某个模型 API 填满整个训练过程。

更常见的方法是,利用中等规模模型,对开放互联网数据进行转换。

例如NVIDIA 的 Nemotron 项目将 Common Crawl 转换成一个包含6.3 万亿 token、其中 1.9 万亿 token 为合成生成内容的数据集。

它使用 Mistral NeMo 12B 进行大规模生成,包括Wikipedia 风格改写、问答生成、蒸馏、知识提取等。

计算一下,如果每次 API 调用输出 1000 token,生成 1 万亿 token,需要约10 亿次调用。

生成 15 万亿 token,则需要150 亿次调用。

因此,这并不排除有针对性的采集行为。

但它反驳了一种简单化想象,即某家公司通过 API 获取大量回答,然后直接组成一个前沿模型全部训练数据。

更现实的例子是 FineWeb-Edu。

研究人员让 Llama 3 70B 给 46 万个网页进行教育质量评分,然后用这些评分训练线性回归模型,再将评分推广到 FineWeb 的 15 万亿 token 数据,筛选出 1.3 万亿 token 的教育数据子集。

实验显示,FineWeb-Edu 在多个知识和推理相关基准测试中,超过了他们比较的其他公开网页数据集。

误区五:“我们知道能力到底转移了多少”

目前我没有看到一种方法,或者充分证据,可以准确衡量蒸馏到底贡献了多少能力。

打个比方,老师给学生 1000 道例题。之后学生独自练习 100 万道题,最后考试满分。

那么,多少功劳属于老师?多少属于学生?多少属于练习过程?很难拆分。

现有研究显示了多个方向,一方面,有证据表明带有可验证奖励的强化学习,主要是在让基础模型中已经潜在存在的能力更容易被激活。

另一方面,也有证据显示,教师指导的课程式强化学习,可以扩大模型表现出来的推理边界。

还有一些蒸馏实验表明,可以转移教师模型拥有、但学生模型仅靠原始奖励信号无法获得的信息。

因此,讨论 AI 蒸馏时,更值得关注的问题不是“有没有蒸馏?”而是到底转移了什么?

是答案、推理过程、偏好,还是评分标准?发生在哪个阶段?规模有多大?

这些问题,才是真正决定蒸馏影响程度的关键。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
单价便宜97%分数还反超,DeepSeek新模型把GPT-5.6按在地上摩擦

单价便宜97%分数还反超,DeepSeek新模型把GPT-5.6按在地上摩擦

不掉线电波
2026-09-12 13:30:12
耐克、刘翔均从未向市场公开承认过存在每年200万美元合同类似合作;耐克对外公布过的终身合作运动员不包括刘翔

耐克、刘翔均从未向市场公开承认过存在每年200万美元合同类似合作;耐克对外公布过的终身合作运动员不包括刘翔

鲁中晨报
2026-09-11 12:11:05
杨幂给奢侈品活动站台,裙子短到露臀型,在台上不停拽底裤太尴尬

杨幂给奢侈品活动站台,裙子短到露臀型,在台上不停拽底裤太尴尬

铜臭的历史味
2026-09-12 04:21:59
《牛来》后遗症继续,马德华新片惨败,上映多时票房只有154元,多位巨星助力也没用

《牛来》后遗症继续,马德华新片惨败,上映多时票房只有154元,多位巨星助力也没用

影视高原说
2026-09-12 07:56:19
婚后第一辆车,老婆一坐上去就发现不对劲!浙江夫妻俩当场傻眼:等了几个小时,问题始终没有解决 ,还没开出4S店就想退车…

婚后第一辆车,老婆一坐上去就发现不对劲!浙江夫妻俩当场傻眼:等了几个小时,问题始终没有解决 ,还没开出4S店就想退车…

台州交通广播
2026-09-12 09:38:15
汪小菲晒汪宝最新照,小家伙笑开花,6个月坐得稳辅食吃得香

汪小菲晒汪宝最新照,小家伙笑开花,6个月坐得稳辅食吃得香

情感大头说说
2026-09-12 12:28:03
WTT澳门冠军赛:大爆冷!国乒男单全军覆没,独苗1:4不敌张本智和

WTT澳门冠军赛:大爆冷!国乒男单全军覆没,独苗1:4不敌张本智和

国乒二三事
2026-09-12 12:44:29
随着韩莹0-4,WTT澳门冠军赛女单四强诞生2席:1名中国选手在列

随着韩莹0-4,WTT澳门冠军赛女单四强诞生2席:1名中国选手在列

侧身凌空斩
2026-09-12 13:25:50
“魔法画报”被指耽误急救,当事人致歉:与荣耀无关,老人用X70正常拨打求救电话;荣耀表示哀悼,不予追究

“魔法画报”被指耽误急救,当事人致歉:与荣耀无关,老人用X70正常拨打求救电话;荣耀表示哀悼,不予追究

界面新闻
2026-09-12 12:07:29
女子偷拍至少15位高僧5600段不雅视频,8万张照片,勒索3.85亿泰铢,泰国高僧性丑闻事件发酵

女子偷拍至少15位高僧5600段不雅视频,8万张照片,勒索3.85亿泰铢,泰国高僧性丑闻事件发酵

汉史趣闻
2026-09-11 16:49:53
国宝没了没人管,举报国宝没了的人,被管到活不下去

国宝没了没人管,举报国宝没了的人,被管到活不下去

南传
2026-09-12 06:51:18
没想到,董建华去世仅1天,梁振英因一个举动,实现了口碑暴增

没想到,董建华去世仅1天,梁振英因一个举动,实现了口碑暴增

和风聊历史
2026-09-11 14:57:40
今日韩国前总统无罪释放!第一夫人悔不当初,称自身财富尽数丧失

今日韩国前总统无罪释放!第一夫人悔不当初,称自身财富尽数丧失

梦在深巷aqa
2026-09-12 10:11:02
港媒曝钟丽淇疑患渐冻症,本人发文:恳请大家多给一些私人空间

港媒曝钟丽淇疑患渐冻症,本人发文:恳请大家多给一些私人空间

调侃国际观点
2026-09-12 07:32:49
坐滩破船仍未拖走,渚碧礁再起冲突,菲抢先挑衅,解放军被迫出手

坐滩破船仍未拖走,渚碧礁再起冲突,菲抢先挑衅,解放军被迫出手

面包夹知识
2026-09-11 20:31:23
iPhone Duo把信号电量合成一个圈,这设计你买账吗?

iPhone Duo把信号电量合成一个圈,这设计你买账吗?

菜但瘾大第一名
2026-09-11 18:11:59
新加坡真急了,但已经晚了

新加坡真急了,但已经晚了

刻面
2026-09-11 13:59:56
25位菲尔兹奖得主联合警告:AI与数学正在出现“严重错位”

25位菲尔兹奖得主联合警告:AI与数学正在出现“严重错位”

第一财经资讯
2026-09-12 10:18:33
俄罗斯挖出圣人遗骸送往前线为士兵打气,乌克兰回应堪称教科书

俄罗斯挖出圣人遗骸送往前线为士兵打气,乌克兰回应堪称教科书

律法刑道
2026-09-12 09:09:55
欧盟逼康宁改掉的“违规操作”,正是国内产业链承受多年的常态

欧盟逼康宁改掉的“违规操作”,正是国内产业链承受多年的常态

科技四少
2026-09-11 23:13:36
2026-09-12 15:36:49
AI先锋官 incentive-icons
AI先锋官
AIGC大模型及应用精选与评测
668文章数 104关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

哈里夫妇返回英国 不满被国王信函定义为"普通公民"

头条要闻

哈里夫妇返回英国 不满被国王信函定义为"普通公民"

体育要闻

老鹰真正的底气来自于什么?

娱乐要闻

港媒曝钟丽淇疑患渐冻症,本人发文

财经要闻

继房子茅台后 中产的第3个"神话"破灭了

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

旅游
家居
数码
艺术
公开课

旅游要闻

呼和浩特:工业文旅赋能“世界乳都”建设

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

Wildcat Lake款戴尔14轻薄本上市:酷睿5 320版5999元

艺术要闻

211米!义乌第二高楼,封顶了

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版