网易首页 > 网易号 > 正文 申请入驻

Meta新研究:字节模型蒸馏后,天花板破了

0
分享至

henry 发自 凹非寺
量子位 | 公众号 QbitAI

Token词元替代了Byte字节,但不意味着大模型都得是Token。

字节模型,特别是蒸馏后,有点儿新说法。

最近,来自Meta FAIR和华盛顿大学的论文《突破Token天花板:蒸馏出更小、更强的字节模型》,提出了一个很有趣的想法——

蒸馏的时候,能不能把学习单位从词元(Token)换成字节,让学生模型直接从字节(byte)级别的概率分布学起?



结果还真可以~

团队给每个Token加上结束标记,把教师的Token概率分布完整转换到字节级别。在以Llama 3-8B为教师的蒸馏实验中,团队根据缩放定律预测:

随着训练计算量增加,字节级蒸馏将反超Token级蒸馏,下游平均准确率上限高出4个百分点



传统蒸馏让学生学习教师在庞大Token词表上的概率分布。相比之下,字节只有256种基础取值,单个位置的预测空间更小,基础取值也不随分词器改变。

换句话说,学习的基本单位反而更小了,模型最终能学到的能力上限却更高了。

这是怎么做到的?

字节级蒸馏

其实到今天,蒸馏已经不是什么陌生技术了。我们都知道,大的模型能力更强,但把它部署到实际应用中,显存、计算和响应速度都是成本。

于是,一个常见做法,就是让大模型当老师,把能力蒸馏给更小的学生模型。

和普通监督训练只告诉模型“下一个正确Token是什么”不同,蒸馏还会让学生学习教师对各个候选Token的概率判断



但问题也出在这里。Token的候选空间实在太大。以Llama 3-8B为例,它的词表包含128256个Token,这意味着每一个预测位置,都对应十几万个候选概率。

如果做离线蒸馏,把完整概率分布全部保存下来,存储成本会非常高。因此实际操作中,通常只能保留概率最高的一部分,也就是top-k截断

而字节模型,刚好把这个候选空间一下压小了。

一个字节由8个比特组成,共有256种可能的取值。即使加上少量特殊符号,每个位置需要保存的概率也不过两百多个,完整分布自然更容易保留下来。

不过,教师预测的是整个Token,学生预测的是单个字节。要让两者对上,不能只把文本拆开,还得把教师的概率分布一起转换过去。

这正是论文首先解决的问题。

具体的,团队提出了两种方案,分别叫作Marginalize-ItEnd-Of-Token



两者的基本思路基本相同:把教师对不同Token的概率,逐步分解到对应的字节位置上。

以论文里的Tiramisu为例,它可能被tokenizer切成 T、iram、isu几个Token。

假设教师在预测下一个 Token 时,候选里同时有 isu、isk 和 is。

这三个候选都以字节 i 开头,那么预测第一个字节时,就可以把所有以 i 开头候选的概率加起来。

等真实前缀变成 i,再只保留前缀匹配的候选,继续计算下一个字节的概率。

沿着真实字节序列不断重复,就能把原本的 Token 分布,一步步拆成逐字节的训练目标。

第一种方法Marginalize-It,直接聚合并重新分配概率。

不过,麻烦出现在不同Token长度不一样的时候。

比如已经走到前缀 is,isu 和 isk 后面都还有字节,但 is 这个Token已经结束了。

这时,如果还想知道 is 之后接什么,就需要继续查询教师在这个Token结束后的预测;而不同候选路径,又可能对应不同的后续分布,计算量会迅速增加。

Marginalize-It的处理很直接:

已经结束的候选就不再往后追,把剩余候选的概率重新归一化。

这样只需要一次教师前向计算,效率很高,但代价是会丢掉一部分已经结束 Token的概率信息,因此本质上是一种近似。

第二种方法End-Of-Token,则给「Token结束」留了一个位置。

End-Of-Token则换了一个思路:既然Token会结束,那就干脆给“结束”本身一个明确的预测位置。

具体来说,团队在每个Token末尾加入一个特殊符号。于是原来的三个候选就变成:isu、isk和is。

这样,当已经走到前缀is时,学生接下来既可以预测u,也可以预测k,还可以预测,表示当前Token到这里结束。

原本因为长度不同而“悬空”的那部分概率,就有了明确去处。

因此,End-Of-Token可以在保留Token边界的同时,更完整地把教师分布映射到字节空间。

而且,两种方法都只需要教师做一次前向计算,就能完成从Token分布到字节分布的转换,不必为了不同分词路径反复调用教师模型。

到这里,教师模型的知识,总算可以真正交到字节学生手里了。

接下来要看的,就是它到底能学到多少。

实验验证

团队分别测试了Token、普通字节和带的字节三种表示,每种再分为监督训练与蒸馏训练,一共六组。

这样既能比较蒸馏有没有帮助,也能观察改变学习单位后,模型的训练表现如何变化。

教师统一使用Llama 3-8B。三类学生的Transformer层参数量相同,均约为12.8亿。

计入词表相关参数后,总参数量则有所不同:Token学生约18.1亿,字节学生约12.8亿。

研究逐步增加训练数据和计算量,字节模型的训练覆盖约万亿字节规模,再在选择题问答、语言生成和机器翻译三类任务中完成八项评测。



先看训练过程。

Token模型在计算量较小时学得更快,但很快开始接近平台期;字节模型起步更慢,却随着计算量增加持续改善。

也就是说,Token模型赢在前期效率,字节模型则表现出了更好的Scaling潜力。



不过,如果只看BPB,也就是统一到每字节上的预测损失,几种字节模型很早就已经超过Token模型,但真正拿去做题时,成绩却仍然更低。

之所以这样,是因为BPB衡量的是模型对文本预测得准不准,而下游任务看的是最后答案能不能选对,两者并不是一回事。



所以,团队没有直接拿BPB判断谁更强,而是进一步拟合了:训练计算量 → BPB → 下游任务成绩,再用这条关系预测不同方案继续Scaling后的能力上限。

结果表明,三种蒸馏方案的预测平均准确率上限分别是:

Token蒸馏48.4%,Marginalize-It蒸馏50.5%,End-Of-Token蒸馏52.4%。



也就是说,End-Of-Token最终比传统Token蒸馏高出4个百分点,也是六种方案里预测上限最高的。

不过,蒸馏的优势并非在所有预测中都成立。

普通字节监督模型的渐近准确率预测为51.2%,高于Marginalize-It蒸馏的50.5%。

论文认为,这里的原因很可能就是前面提到的:Marginalize-It为了省计算,丢掉了一部分Token结束后的概率信息。

而能够更完整保留教师分布的End-Of-Token,则同时超过了自己的监督版本和其他所有方案。



进一步,按照Scaling曲线继续往外推,End-Of-Token大约在6.33×10²² FLOPs时,就能追平Token蒸馏48.4%的预测上限。

在最后,实验还表明字节级蒸馏能显著降低数据和教师分布的存储压力。

团队还把这些渐近预测,与现有开放权重模型进行了比较。

按照论文的预测计算预算,End-Of-Token处理的实际文本量约为Token方案的六分之一

在Token只保存top-600、字节保存完整分布的设置下,存储量也只有约五分之一



不过,更少的数据,也不代表更少的计算。

尤其End-Of-Token还在每个Token后加入了,处理相同文本量时,训练计算量比普通字节模型还要再高约30.94%。

与此同时,推理成本也是同样的问题,论文目前还没有完成等推理成本下的公平比较。

所以总的来说,这项工作展示了一条小模型训练的新路径:把教师的知识转换到字节级别,让学生用更小的预测空间、更少的训练文本,争取更高的能力上限。

End-Of-Token在这组实验的外推中表现最好,但要兑现这一潜力,还需要继续投入计算。

作者介绍

最后,让我们介绍一下文章的作者们。

论文一作Kalyani Marathe是华盛顿大学博士生,师从Luke Zettlemoyer,研究兴趣主要集中在大模型训练、模型架构与Scaling。

她此前曾在Meta AI Research实习,也在Amazon Robotics 的 Foundation Models团队工作过。



Artidoro Pagnoni是华盛顿大学计算机系博士生、Meta访问研究员,研究重点是大模型的资源效率与Scaling,此前曾就读于CMU和哈佛大学。

他也是Byte Latent Transformer(BLT)和QLoRA的核心作者之一,后者将大模型微调的显存需求大幅降低。



Tomasz Limisiewicz是华盛顿大学和Meta的博士后研究员,此前在查理大学获得博士学位。

他主要研究大语言模型如何学习和迁移能力,尤其关注数据、模型内部机制、Tokenization,以及低资源语言和模型鲁棒性。



Margaret Li是华盛顿大学博士生,师从Luke Zettlemoyer和Tim Althoff,同时也是Meta FAIR的访问研究员。

她的研究涉及大模型高效训练与生成、条件计算、可控性和安全,此前还曾担任FAIR研究工程师,参与开放域对话等方向的研究。



Mike Lewis是Meta FAIR研究科学家,也是Llama 3预训练负责人之一。

他此前参与了RoBERTa、BART、CICERO、kNN-LM、Attention Sinks和Top-k Sampling等多项代表性工作。



Luke Zettlemoyer是华盛顿大学Allen School教授,同时担任Meta FAIR Seattle负责人,长期研究语言模型预训练、语义解析、问答和多语言NLP。

他曾获得美国总统青年科学家与工程师奖(PECASE),并在顶级NLP会议上获得十余项论文奖。



Srinivasan Iyer是Meta FAIR研究科学家,研究方向涵盖语言建模、文本生成、摘要、可解释性和问答。

他在华盛顿大学获得计算机博士学位,师从Luke Zettlemoyer和Alvin Cheung,博士阶段重点研究自然语言与通用源代码的联合建模。



[1]https://arxiv.org/pdf/2609.12303

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
贺子珍始终认定朱道来便是战乱之中失散的儿子,可朱道来后来坦言:过去他没有道出所有真相

贺子珍始终认定朱道来便是战乱之中失散的儿子,可朱道来后来坦言:过去他没有道出所有真相

唠叨说历史
2026-09-15 14:16:32
美军承认损失惨重!特朗普仍称"武器产量创新高"

美军承认损失惨重!特朗普仍称"武器产量创新高"

看看新闻Knews
2026-09-15 12:13:40
大快人心!北大教授张丹丹被免去北大国家发展研究院副院长等职务,彻底自由了

大快人心!北大教授张丹丹被免去北大国家发展研究院副院长等职务,彻底自由了

小徐讲八卦
2026-09-14 14:52:38
女子想让情夫多睡几次被杀,情夫:过节我要睡女友,没精力睡她只能杀掉

女子想让情夫多睡几次被杀,情夫:过节我要睡女友,没精力睡她只能杀掉

汉史趣闻
2026-09-15 10:19:43
贫穷能让一个人有多卑微?网友:给05年小富婆妹当过狗,还给130斤小富婆做了俩月男朋友

贫穷能让一个人有多卑微?网友:给05年小富婆妹当过狗,还给130斤小富婆做了俩月男朋友

带你感受人间冷暖
2026-09-15 00:05:19
忍无可忍,无需再忍!一场恶仗已逼近中国,东大不必再手下留情了

忍无可忍,无需再忍!一场恶仗已逼近中国,东大不必再手下留情了

乌克兰小静
2026-09-15 08:09:52
胖东来新员工干满四年一律走人,那个说"把员工当家人"的于东来,这回没法自圆其说了

胖东来新员工干满四年一律走人,那个说"把员工当家人"的于东来,这回没法自圆其说了

子非鱼人
2026-09-15 01:22:27
双预警齐发,中央气象台:今晚到明晚,四川、重庆、湖北、广西、海南岛等地有暴雨,广东、湖南等地有短时强降水天气

双预警齐发,中央气象台:今晚到明晚,四川、重庆、湖北、广西、海南岛等地有暴雨,广东、湖南等地有短时强降水天气

新快报新闻
2026-09-15 18:57:08
中阿联合军演在中国某地开始!双方战机都藏一手,派出什么罕见机型?

中阿联合军演在中国某地开始!双方战机都藏一手,派出什么罕见机型?

军武次位面
2026-09-14 18:29:29
中建四局疯狂出差的董事长、总经理

中建四局疯狂出差的董事长、总经理

新浪财经
2026-09-15 11:29:43
李途纯病逝,凌娅被网友深扒遭抨击!

李途纯病逝,凌娅被网友深扒遭抨击!

细品名人
2026-09-15 07:16:40
民调:美国共和党支持率与民主党差距拉大

民调:美国共和党支持率与民主党差距拉大

新华社
2026-09-15 17:08:06
韩国菲律宾联合抗议亚运住宿!中国官媒发声:寒酸 日本丢基本体面

韩国菲律宾联合抗议亚运住宿!中国官媒发声:寒酸 日本丢基本体面

风过乡
2026-09-15 13:47:08
突发! 中国出入境新规今天生效, 在澳华人接到公安排查通知! 大批人出入境受影响…

突发! 中国出入境新规今天生效, 在澳华人接到公安排查通知! 大批人出入境受影响…

澳洲红领巾
2026-09-15 15:25:05
四川一考生211报到后心态崩了,仅4天退学,生物工程专业,本人回应:高考都没考生物

四川一考生211报到后心态崩了,仅4天退学,生物工程专业,本人回应:高考都没考生物

育学笔谈
2026-09-15 15:07:39
哦豁!华为和赛力斯,突然宣布“分手”?

哦豁!华为和赛力斯,突然宣布“分手”?

说财猫
2026-09-15 12:31:34
国家统计局:从下阶段情况看,尽管面临压力和挑战,但我国经济长期向好的基本面没有变

国家统计局:从下阶段情况看,尽管面临压力和挑战,但我国经济长期向好的基本面没有变

红星新闻
2026-09-15 12:34:37
中国男子被指在印尼猎杀濒危玳瑁,本人发声:遭大量PADI潜水教练恶意造谣,真正猎杀的人可能已离开印尼;此前其准备离开时在机场被拦截

中国男子被指在印尼猎杀濒危玳瑁,本人发声:遭大量PADI潜水教练恶意造谣,真正猎杀的人可能已离开印尼;此前其准备离开时在机场被拦截

大风新闻
2026-09-15 16:16:04
赵一鸣早该查了,4块5的红牛,喝的不是提神,是套路!

赵一鸣早该查了,4块5的红牛,喝的不是提神,是套路!

椰青美食分享
2026-09-14 11:20:34
黄仁勋论坛现场接特朗普电话:不会让AI减速发生,“AI末日论”没有科学依据

黄仁勋论坛现场接特朗普电话:不会让AI减速发生,“AI末日论”没有科学依据

澎湃新闻
2026-09-15 09:46:26
2026-09-15 19:55:00
量子位 incentive-icons
量子位
追踪人工智能动态
13319文章数 176562关注度
往期回顾 全部

科技要闻

芯片产业链蒸发超5000亿美元,特朗普大怒

头条要闻

盗窃犯刑满释放前8天改判死缓 检方称其"天生的罪犯"

头条要闻

盗窃犯刑满释放前8天改判死缓 检方称其"天生的罪犯"

体育要闻

皇马启动舆论攻势,为姆巴佩冲击金球造势

娱乐要闻

谢霆锋示爱王菲、和前妻划清界限

财经要闻

黄仁勋接到特朗普电话:AI风险论是"骗局"

汽车要闻

小鹏G9L第二代VLA体验:“理解时间”会推理的老司机

态度原创

房产
本地
家居
数码
教育

房产要闻

双国企兜底 |海建雅居:海口主城少有的「地段 + 教育 + 商业 + 精装」全能安居大盘

本地新闻

不止胖东来!许昌藏着半部三国史

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

可孚医疗三款健康设备接入开源鸿蒙:覆盖血压、体温与血糖监测

教育要闻

图片看起来太复杂了,无从下手

无障碍浏览 进入关怀版