网易首页 > 网易号 > 正文 申请入驻

帝国理工陆永青院士团队提出MoE推测解码新范式,专家卸载吞吐达到2.06倍!

0
分享至

智猩猩AI整理

编辑:BugMaker

MoE 模型已经把每个 token 的计算压到了少数几个专家上,但到了推测解码,另一个问题冒了出来。

一次验证的不只是一个 token,而是一棵 draft tree。树上不同节点可能走向不同专家,最后真正进入输出的只是少数节点,整棵 draft tree 却可能把更多专家卷进这次验证,带来额外的专家计算和权重访问

8月4日,Imperial College London 联合 TileLang 背后的 AI Infra 团队 Tile-AI 提出AcceptMoE。英国皇家工程院院士、IEEE Fellow陆永青(Wayne Luk)参与其中,直接优化目标模型验证阶段的专家选择,让每轮验证自动决定哪些 MoE 专家值得参与。


它不要求用户提前指定固定的 expert budget,也不依赖额外的专家预测器。实验覆盖Qwen3-30B-A3B-Instruct-2507、Qwen3-Coder-30B-A3B-Instruct 和 GPT-OSS-120B

在 SGLang 中,全部专家权重位于 GPU 时,AcceptMoE 吞吐量达到 Standard SD 的1.290 倍。采用物理专家卸载后,吞吐达到 Standard SD 的2.06 倍,同时将 Host-to-Device 数据传输量降低73.6%—77.1%

代价并不大。12 个模型–任务组合上的平均准确率,仅比使用原生路由的 Standard SD低 0.27 个百分点

01

少验证一些token,为什么

专家还是搬了一大堆

推测解码(Speculative Decoding)通常先让 draft model 一次提出多个候选 token,再交给目标模型并行验证。

放到混合专家模型(Mixture-of-Experts,MoE)上,每个 token 虽然只会选择 top-k 专家,但不同 draft node 选择的专家并不相同

在原生路由下,一棵 draft tree 验证下来,真正需要访问的是所有节点所选专家的并集,也就是激活专家并集(activated-expert union)

问题也出在这里。

很多 draft branch 最后都会被丢掉,可它们对应的专家权重已经产生了计算和访存开销。

论文引用的结果很直观。在 Qwen3-30B-A3B 上,EVICT 相比 EAGLE-3 将验证 token 数减少74.7%,激活专家数量却只减少32.5%

少验证 token,并不意味着专家数量会同步减少。


已有的 verifier-side 方法 MoE-Spec 需要提前指定专家预算 B,并在每层固定保留排名最高的 B 个专家。,而且在汇总 Router 概率时,对 draft tree 中不同位置一视同仁。

但越深的节点,本来就越不容易真正进入最终输出。

AcceptMoE 要解决的,就是哪些专家值得留,以及到底应该留多少个

02

不再固定专家数量,

AcceptMoE自己决定留谁

AcceptMoE 首先引入commitment probability,即某个草稿节点最终真正进入被接受输出前缀的概率

这里不能简单理解成“token 接受率”。它表示某个 draft position 上的节点,最终真正进入 accepted output prefix 的概率

团队提前从训练集验证轨迹中估计这个概率,再用它给 target Router 的分数加权。

直观来看,越可能真正进入输出的节点,它需要的专家就越重要。那些位于深层、最后大概率被丢弃的节点,对专家选择的影响会被压低。

接着,AcceptMoE 会保留一个root anchor,也就是 draft tree 根节点原本选择的 top-k 专家。根节点一定会进入输出,因此这部分专家优先保留。

剩下留多少专家,不再手动给一个 B。

AcceptMoE 根据专家需求分布的有效秩(effective rank)自动确定集合大小。需求集中时少留一些,需求分散时多留一些。

在 12 个模型–任务组合中,最终自动选择的平均专家集合规模约为23—34 个


进入专家卸载场景后,问题又变了一层。

一个专家如果已经在 GPU 中,直接运行即可。没有驻留的专家,则需要从 CPU 内存加载。

AcceptMoE 因此加入Residency-Aware Pruning。它优先检查低需求的非驻留专家,在 rerouting budget 和最小集合规模允许的范围内继续裁剪。

不是预测下一步要加载谁,而是直接根据现在 GPU 里有什么,改变哪些专家还能被选择。

整个过程不需要额外 learned expert predictor,也不需要预设 expert budget。

03

全驻留1.29倍,专家卸载

直接做到2.06倍

实验统一采用 EAGLE-3 draft tree,设置5 个 draft steps、EAGLE top-k=10、64 个 draft tokens,测试 GSM8K、MATH500、HumanEval 和 MBPP。

全驻留实验运行在一张RTX PRO 6000 Blackwell上,batch size=1,并使用SGLang 0.5.12.post1

AcceptMoE 在全部 12 个模型–任务组合中都超过 Standard SD,平均吞吐提升到1.290 倍,单项范围为1.217—1.339 倍,最高达到257 tokens/s

更关键的是,AcceptMoE 和 Standard SD 的平均 accepted length 都约为4.39 个 token

这部分加速并不是因为一次接受了更多 token,而是因为每次验证实际涉及的专家更少。


到了真正需要搬运专家权重的场景,差距进一步拉开。

在一张RTX 5090上,每层配置 48 个 expert slots。Standard SD 有65%—78%的运行时间花在等待专家权重加载上,AcceptMoE 将这一比例降到27%—35%

最终,AcceptMoE 相比 Standard SD 的平均吞吐达到2.06 倍


背后的数据传输变化更明显。

AcceptMoE 将三种目标模型的 H2D 专家权重传输量分别降低73.6%、77.1% 和 76.0%,专家缓存命中率则提高10.8、12.6 和 14.2 个百分点

04

自动选专家,离最优固定

配置有多远

AcceptMoE 并不是简单地“少留几个专家”。

在相同 expert budget 下,使用 Commitment-Weighted Demand 的AcceptMoE-B 平均准确率达到 90.60%,MoE-Spec 为88.15%,前者高出2.45 个百分点

也就是说,即使专家数量完全相同,挑哪些专家仍然很重要

至于 Self-Sizing 能不能代替逐个任务调参,论文专门扫描了 5 个模型–任务组合。

AcceptMoE 自动选择出的点,与每个任务实测出的最佳固定预算相比,平均只低0.97 个百分点,最差差距为1.83 个百分点

在论文扫描的最小固定预算点,准确率相较各自最佳实测配置最多下降 92.1 个百分点。一个模型上合适的 B,换到另一个模型也未必合适。


Residency-Aware Pruning 单独开启后,又能将专家权重传输量降低38.6%—48.6%,缓存命中率提高6.9—8.2 个百分点,吞吐量提高4.6%—15.1%

对应的平均准确率变化只有−0.27 个百分点

AcceptMoE 的思路其实很明确。

MoE 推测解码不能只盯着“验证了多少 token”,还要继续追问一句,这些 token 到底把多少专家卷进了这次验证,又有多少专家真的值得从 CPU 搬进 GPU。

关注+星标,获取AI前沿进展与优质开源项目

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
余晓晖已任工信部部领导

余晓晖已任工信部部领导

澎湃新闻
2026-09-18 17:20:31
问界这次的瓜,真的有点大啊!

问界这次的瓜,真的有点大啊!

芝麻科技讯官方号
2026-09-18 00:06:07
离谱!名古屋亚运会邮轮的床是纸板拼成的 新加坡选手当场震惊

离谱!名古屋亚运会邮轮的床是纸板拼成的 新加坡选手当场震惊

念洲
2026-09-18 16:39:48
店员被曝将头屑撒至比萨上,还多次对菜品吐口水,最新进展:因寻衅滋事,涉事店员被行拘7日!

店员被曝将头屑撒至比萨上,还多次对菜品吐口水,最新进展:因寻衅滋事,涉事店员被行拘7日!

每日经济新闻
2026-09-18 00:57:57
松岛辉空:无论王楚钦状态多好,我都能抗衡!日本5成实力可胜中国

松岛辉空:无论王楚钦状态多好,我都能抗衡!日本5成实力可胜中国

十点街球体育
2026-09-18 06:05:06
中国男篮19分之差惨败日本 媒体人:人家4混血+1归化+1韩裔+1华裔

中国男篮19分之差惨败日本 媒体人:人家4混血+1归化+1韩裔+1华裔

劲爆体坛
2026-09-18 20:27:04
国乒最新战报!王艺迪3连胜,男双单局被轰11-0,姚睿轩险爆冷大藤沙月!

国乒最新战报!王艺迪3连胜,男双单局被轰11-0,姚睿轩险爆冷大藤沙月!

刘姚尧的文字城堡
2026-09-18 17:27:57
最佳血压是多少?医生建议:过了71岁以后,血压最好保持这标准

最佳血压是多少?医生建议:过了71岁以后,血压最好保持这标准

路医生健康科普
2026-09-18 18:07:47
破案!中国队一场没踢就淘汰不怪规则 日本亚运会官员:我们没钱

破案!中国队一场没踢就淘汰不怪规则 日本亚运会官员:我们没钱

念洲
2026-09-18 08:03:35
“再不敢手贱了!”50岁大叔被可乐瓶“咬”住命根子,医生:再拖下去可能坏死

“再不敢手贱了!”50岁大叔被可乐瓶“咬”住命根子,医生:再拖下去可能坏死

南方都市报
2026-09-16 07:58:15
苏群谈男篮惨败日本:特殊日子舆论压力太大,先从心态崩溃开始

苏群谈男篮惨败日本:特殊日子舆论压力太大,先从心态崩溃开始

全景体育V
2026-09-18 20:25:01
超级乌龙!亚运曲棍球赛前将韩国国歌放成朝鲜 韩方搜集证据抗议

超级乌龙!亚运曲棍球赛前将韩国国歌放成朝鲜 韩方搜集证据抗议

醉卧浮生
2026-09-18 16:10:14
这跟不穿有什么区别?大露背副乳险走光,35岁女星直播穿搭引争议

这跟不穿有什么区别?大露背副乳险走光,35岁女星直播穿搭引争议

历史点行
2026-09-17 12:59:13
管家转卖雇主酒水获利243万元被判刑10年半,家属称将申诉

管家转卖雇主酒水获利243万元被判刑10年半,家属称将申诉

澎湃新闻
2026-09-17 16:58:28
特朗普要大开杀戒了:摆不平中俄伊,就将目标对准美国盟友?

特朗普要大开杀戒了:摆不平中俄伊,就将目标对准美国盟友?

铁锤侃侃而谈
2026-09-18 00:11:26
延迟退休实施一年多,一个尴尬的问题终于摆上了台面

延迟退休实施一年多,一个尴尬的问题终于摆上了台面

锅锅爱历史
2026-09-17 10:13:43
为何 KFC 要几乎强制手机点单?看网友的吐槽:引起万千共鸣

为何 KFC 要几乎强制手机点单?看网友的吐槽:引起万千共鸣

另子维爱读史
2026-09-17 20:41:04
大势戛然而止!魏德尔无缘总理,选择党孤立无援,德政坛迎大变局

大势戛然而止!魏德尔无缘总理,选择党孤立无援,德政坛迎大变局

赫逗足球解说
2026-09-18 14:11:18
珍爱生命,远离短剧!仅仅6年,6亿人“中毒”AI短剧

珍爱生命,远离短剧!仅仅6年,6亿人“中毒”AI短剧

东方不败然多多
2026-09-15 08:47:07
媒体人热议男篮输球:赛前没人想到这结果,比打日本一队还惨

媒体人热议男篮输球:赛前没人想到这结果,比打日本一队还惨

懂球帝
2026-09-18 20:26:57
2026-09-18 21:19:00
智猩猩
智猩猩
AI 技术内容与服务平台
135文章数 6关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

外媒提问"中方领导人是否将访问美国" 外交部正面回应

头条要闻

外媒提问"中方领导人是否将访问美国" 外交部正面回应

体育要闻

一个角色球员,靠什么在NBA征战17年

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

研发0.25亿理财26亿,敷尔佳豪赌三类器械

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

家居
艺术
亲子
旅游
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

文徵明5毫米小楷现身美国,写了三年才完成,这字用放大镜才能看清!

亲子要闻

走进爱他美放心工厂:以食品安全守护万千妈妈信任

旅游要闻

国庆中秋乡野“行酒令”!成都农业发布“天府秋稼”乡村游路线,循着酒香游成都

军事要闻

中方反对在安理会强推恢复对伊朗制裁

无障碍浏览 进入关怀版