网易首页 > 网易号 > 正文 申请入驻

深度拆解 MiMo-V2.6:1M 上下文只是表面,2.5 万条轨迹才是底牌

0
分享至


代码、视觉、安全共用一套 RL,奖励机制也被重新设计。

作者丨郑佳美

编辑丨岑 峰

刚刚,小米正式发布并开源 MiMo-V2.6。Pro 拥有 1.02T 总参数、42B 激活参数,Flash 为 309B 总参数、15B 激活参数,两款模型支持 1M token 上下文,并覆盖文本、图像、视频和音频输入。

如果只看这些数字,第一反应或许会觉得这又是一次模型规模升级。但这次小米投入更多篇幅讨论的,其实是模型完成预训练之后,能力还能怎样继续往上推。


这也是为什么后训练成了 MiMo-V2.6 的核心部分。小米把代码、通用 Agent、视觉和网络安全任务放进同一套强化学习系统,单次 RL 更新使用 1568 个 prompt,每个 prompt 生成 16 条 rollout。

和普通问答不同,Agent 在这些任务里不是生成一段文本就结束,而是要不断读取环境、搜索信息、调用工具、执行操作,再根据返回结果调整下一步行动。训练对象因此不再只是最终答案,而是一整条包含状态、决策和反馈的行为轨迹。


当强化学习开始围绕这种长轨迹展开,问题自然也变了。模型不仅要承担更长上下文和持续生成带来的计算开销,还要同时处理大量执行时间完全不同的任务,等轨迹数量真正上来以后,单纯依靠成功或失败这样的奖励,又很难判断两条都完成任务的路径,哪一条更值得模型学习。

所以 MiMo-V2.6 后面的架构、异步训练和奖励设计,基本都是从这些实际问题里一步步长出来的。

01


1M 上下文背后

Agent 一旦开始长期停留在环境里,模型面对的计算形态就发生了变化。

以软件工程任务为例,模型可能先读取大量代码,随后搜索文件、修改函数、运行测试,再根据 terminal 返回继续行动。早期读取的内容需要留在上下文里,但当前一次决策真正频繁使用的,往往只是正在处理的代码、最近几轮工具结果以及局部状态。

MiMo-V2.6-Pro 的注意力结构正好利用了这种特征。70 层 Transformer 中,60 层采用 Sliding Window Attention,窗口只有 128 token,另外 10 层使用 Global Attention。也就是说,绝大多数层只处理附近信息,隔一段距离再由全局层完成长距离通信。


这样设计之后,1M 上下文并不意味着每一层、每一个 token 都要重新和完整上下文进行交互。当前操作需要的局部信息可以高频流动,远处的信息则通过少量全局层重新汇合。对于长时间运行的 Agent,这比把完整注意力铺满整个网络更符合实际工作负载。

参数侧采用了类似思路。Pro 虽然拥有 1.02T 总参数,每个 token 实际只激活约 42B 参数,每个 MoE 层有 384 个 routed expert,其中只调用 8 个。模型因此可以维持较大的专家容量,又不需要让每个 token 穿过全部参数。

这里的意义放到 RL 阶段会更明显。一次回答多算几个 token,成本差异有限,一次训练里同时生成数万条 rollout,每条轨迹又持续几十轮,任何单 token 计算量的增加都会被迅速放大。


MiMo-V2.6 还加入了 5 层 MTP speculative decoder,drafter 一次前向可以尝试给出后续多个 token,再交给主模型并行验证。官方模型卡给出的设计是一次前向预测后续 7 个 token。

SWA、Sparse MoE 和 MTP 放在一起看,就能看出 MiMo-V2.6 架构上的取舍:大容量负责装下能力,稀疏计算和局部注意力控制每一步的代价,推测解码则继续提高生成速度。

当单条轨迹能够以更低成本持续生成,RL 才有空间把 rollout 的数量推上去。而到了 MiMo-V2.6 这种一次更新就产生两万多条轨迹的规模,计算压力开始从模型内部蔓延到整个训练系统。


02


RL 开始像分布式生产系统

1568 个 prompt,每个采样 16 条 rollout,一次更新对应 25088 条 trajectory。困难之处在于,这 25088 条轨迹不会按照统一节奏结束。

有的代码任务几轮操作就找到问题,有的会不断运行测试、读取报错再重新修改;网络安全任务可能经历多次环境验证,视觉 Agent 又有不同的执行链路。轨迹长度、工具延迟和环境响应混在一起以后,一个 batch 内部很容易出现明显的长尾。

如果继续采用严格同步方式,已经完成任务的计算资源需要等待少数仍在运行的轨迹。规模越大,这种等待造成的资源浪费越明显。

MiMo-V2.6 用 fully asynchronous GRPO,把 rollout、环境执行、grader 和模型更新拆开运行。生成侧完成一条轨迹后可以继续领取任务,环境执行与评分各自推进,训练侧消费已经准备好的数据,不再要求一整个 batch 同时跨过每个阶段。

这种变化看起来属于工程优化,却直接影响了小米怎样组织 RL 数据。

MiMo-V2.6 没有为代码、通用 Agent、视觉和网络安全分别训练一套独立策略,而是把多领域任务以及不同 Agent harness 混入同一次 RL,小米将其称为 You Only RL Once。


原因在于这些任务虽然环境不同,内部却共享大量决策结构。模型需要判断当前状态缺什么信息、该调用哪个工具、执行结果是否符合预期、失败以后应该继续搜索还是修改方案。多个领域一起训练,这些行为策略可以直接在同一个 policy 中发生迁移。

多个 harness 的作用则更隐蔽。不同框架会改变 system prompt、工具定义和上下文组织方式,模型反复面对不同交互外壳后,就更难把某一种固定接口当成解题捷径。训练压力逐渐落到状态理解、工具选择和环境反馈这些更底层的能力上。


走到这里,Agent RL 的瓶颈已经发生了一次变化。模型能够比较高效地产生长轨迹,异步系统也能够持续吞吐不同环境,真正稀缺的东西开始变成轨迹里的有效反馈。

因为 25088 条 trajectory 并不天然等于 25088 份高质量训练信号。

03


从 GRS、GAR 到 MOPD2

传统可验证 RL 很依赖 binary reward。代码通过测试得到正向奖励,失败则没有。对于短任务,这种反馈已经足够清晰,但放进几十步甚至更长的 Agent 轨迹以后,大量过程差异会被压成同一个数字。

假设同一道任务生成 16 条 rollout,其中 5 条通过测试。一条可能快速定位根因,只修改必要代码。另一条经历大量无效搜索,还有一条虽然通过测试,却引入许多额外修改。只看 pass / fail,这几条成功轨迹很难拉开差距。

MiMo-V2.6 因此把 grader 从结果检查器进一步变成组内比较器。

GRS,也就是 Groupwise Reward Synthesis,会同时观察同一道任务产生的多条 rollout,从它们之间已经出现的差异中构造 task-specific rubric,再把过程质量与测试结果结合起来。评价标准因此会随着当前 policy 实际暴露出来的问题发生变化。

GAR(Groupwise Advantage Redistribution)则进一步影响策略更新。即使几条 trajectory 全部完成任务,grader 仍会继续比较它们,再把更多 advantage 分配给质量较高的方案。

官方也明确提到,这套过程会结合环境加固、异常筛查和 verifier cross-check 来处理 reward hacking。这里带来的变化很直接:RL 的计算投入不再只用来制造更多样本,还开始投入到理解样本。


当 rollout 数量已经很大时,再增加一批只有 0 和 1 的轨迹,信息增量可能有限,grader 如果能够继续拆出成功方案之间的质量差异,同样一轮环境交互便能产生更丰富的梯度信号。

可验证任务能够依赖这一套机制,开放式 Agent 却还有另一类困难。很多任务缺少稳定的自动 verifier,即使模型完成了一段复杂操作,也很难仅靠环境给出可靠评分。

MiMo-V2.6 在混合 RL 之后又加入 MOPD2,也就是 Multi-Prefix Multi-Teacher On-Policy Distillation。它会复用 Teacher trajectory 和 SFT demonstration 中已经存在的历史,把轨迹截取到某个中间状态,再让学生从这里继续 rollout。

假设一条 Agent 任务需要 40 步才能到达关键决策位置,训练这个位置时就不必反复生成前面 39 步。历史状态可以直接作为 prefix,训练资源集中到后续决策,同时一条教师轨迹还能提供多个可复用的训练起点。

GRS 和 GAR 解决的是可验证任务中反馈过粗的问题,MOPD2 则把高质量教师轨迹中的决策信息带进难以自动评分的区域。

MiMo-V2.6 也因此把 RL 的扩张从 rollout 数量继续推进到了反馈密度和轨迹复用。

04


Agent RL 正在从算法变成系统工程

MiMo-V2.6 给出的信号,其实已经超出了某一种 RL 算法本身。

Agent 进入真实环境以后,训练数据不再只有静态 token,还多出了状态、工具调用、执行结果、错误反馈和连续决策。模型需要亲自走过这些过程,才能产生一条能够用于强化学习的 trajectory。

这也让后训练的竞争维度发生了扩展。模型架构要能够承受长时间生成,分布式系统要持续运行大量异步环境,grader 要从成功轨迹中进一步拆出质量差异,教师轨迹还要被复用到难以自动验证的任务里。

MiMo-V2.6 依然运行在人设计的任务、环境、评分机制和训练框架内,但它展示出一种很清晰的方向:Agent 能力提升越来越依赖整个训练闭环的吞吐和反馈质量。

参数继续扩大当然还有价值,只是到了 Agent 阶段,另一个变量已经越来越难忽略 —— 一套训练系统能够生产多少有价值的行为轨迹,又能从这些轨迹里转化出多少有效的学习信号。

MiMo-V2.6 的技术意义,更多就落在这里。

参考链接: https://mimo.xiaomi.com/zh/mimo-v2-6

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
广州六中从化校区将整体搬迁至东风片区

广州六中从化校区将整体搬迁至东风片区

从化潮生活
2026-09-22 22:59:24
名古屋亚运会没有任何一名中国运动员的欧美媒体关注度超过于子迪

名古屋亚运会没有任何一名中国运动员的欧美媒体关注度超过于子迪

叒女紫121
2026-09-22 11:28:38
涉非法捕捞,两名中国籍女子在希腊被捕

涉非法捕捞,两名中国籍女子在希腊被捕

以希腊之名
2026-09-22 18:15:36
普雷斯利的离世对辛迪·克劳馥是多大的打击

普雷斯利的离世对辛迪·克劳馥是多大的打击

小椰的奶奶
2026-09-23 02:13:40
明日秋分,“打死”都不能买的7种食物,别贪便宜买来吃,别大意

明日秋分,“打死”都不能买的7种食物,别贪便宜买来吃,别大意

椰青美食分享
2026-09-23 11:05:38
2026公立医院新政落地!院长不能靠创收拿钱了,一线医生能松口气吗?

2026公立医院新政落地!院长不能靠创收拿钱了,一线医生能松口气吗?

医客
2026-09-23 12:32:24
0-2!越南U23两球落败,技术流如“绣花”,短板明显,仍闯进8强

0-2!越南U23两球落败,技术流如“绣花”,短板明显,仍闯进8强

汪星人哟
2026-09-22 15:29:22
扮猪吃虎?隐忍四个月,委代总统撕下面具,率几十万大军硬刚美国

扮猪吃虎?隐忍四个月,委代总统撕下面具,率几十万大军硬刚美国

好贤观史记
2026-04-23 16:53:57
沙特的救兵来了,比土耳其还猛,中方已仁至义尽,红海浑水不能蹚

沙特的救兵来了,比土耳其还猛,中方已仁至义尽,红海浑水不能蹚

慕名而来只为你
2026-09-23 15:57:11
演员潘粤明画的一幅鬼画,网友:狗链子画的好!

演员潘粤明画的一幅鬼画,网友:狗链子画的好!

乡野小珥
2026-09-21 04:03:10
中国经济又一次走到了十字路口上

中国经济又一次走到了十字路口上

小筑财经
2026-09-22 06:57:15
伊朗外长与美国总统特使在纽约会晤,特朗普:会谈持续3个小时,伊朗正等着看我在中期选举中的表现,没有道理不在选举后与美国达成协议

伊朗外长与美国总统特使在纽约会晤,特朗普:会谈持续3个小时,伊朗正等着看我在中期选举中的表现,没有道理不在选举后与美国达成协议

政知新媒体
2026-09-23 07:22:05
罗永浩回应西贝员工失业:是理性上的切割,还是在偷换概念博取同情?

罗永浩回应西贝员工失业:是理性上的切割,还是在偷换概念博取同情?

三周檀的鲲
2026-09-22 17:30:53
随着国足0-0阿联酋,朝鲜4-1爆冷伊朗!国足小组第1晋级8强,朝鲜压哨出线

随着国足0-0阿联酋,朝鲜4-1爆冷伊朗!国足小组第1晋级8强,朝鲜压哨出线

体育就你秀
2026-09-23 15:41:28
中秋前夕,全国月饼市场断崖式下滑,“月饼卖不动”登顶热搜第1,月饼促销潮已经提前开启,折扣普遍在6至9折

中秋前夕,全国月饼市场断崖式下滑,“月饼卖不动”登顶热搜第1,月饼促销潮已经提前开启,折扣普遍在6至9折

大风新闻
2026-09-22 16:56:09
猪身上最好吃的部位排行,梅花肉倒数第1,第1很稀有,建议了解

猪身上最好吃的部位排行,梅花肉倒数第1,第1很稀有,建议了解

阿天爱旅行
2026-09-20 06:40:42
超越孙杨最佳成绩,张展硕霸气创亚洲纪录,拿下亚运会第4金

超越孙杨最佳成绩,张展硕霸气创亚洲纪录,拿下亚运会第4金

体娱一家亲
2026-09-23 16:43:00
国家发改委:国内已有14亿部智能手机、5000多万辆电动车、1400多万辆共享单车、1.6亿台可穿戴设备搭载北斗定位服务

国家发改委:国内已有14亿部智能手机、5000多万辆电动车、1400多万辆共享单车、1.6亿台可穿戴设备搭载北斗定位服务

政知新媒体
2026-09-22 10:48:43
以防长警告哈马斯:若再绑走1名以色列人,将摧毁加沙城剩余部分

以防长警告哈马斯:若再绑走1名以色列人,将摧毁加沙城剩余部分

桂系007
2026-09-22 17:13:58
不是吴梦洁龚翔宇,日本主帅坦言低估中国一人,她击垮我们的努力

不是吴梦洁龚翔宇,日本主帅坦言低估中国一人,她击垮我们的努力

生活新鲜市
2026-09-23 14:29:18
2026-09-23 17:27:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7667文章数 20785关注度
往期回顾 全部

科技要闻

2026网易未来大会下午:AI走进现实

头条要闻

33岁黄梅戏女演员确诊癌症 家人公开求助:她想活下去

头条要闻

33岁黄梅戏女演员确诊癌症 家人公开求助:她想活下去

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

5.1米的启境GX7,底盘凭什么又稳又舒服?

态度原创

亲子
房产
本地
艺术
公开课

亲子要闻

红金纳福,萌娃送财

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

艺术要闻

穿浴衣的女子,日本写实画家新作

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版