罗福莉也学雷军开直播了。
大模型圈的新消息一波接一波,罗福莉却在帖子里说,自己已经沉默了近半年。这次,她带来了小米 MiMo 的一场训练直播。
没有主播,没有带货。页面上只有训练曲线,以及一串不断增加的美元数字。
截至 9 月 17 日 16:49,Pro 和 Flash 两条训练线都还没跑满两天。按官方看板设定的费率估算,累计成本已经到了约 137.8 万美元。
有人忙着算账,有人像盯比赛一样盯着曲线,还有工程师把这个页面称为学习强化学习的“金矿”。
罗福莉说,团队这半年一直在研究:强化学习还能扩展到多远?现在,他们把 MiMo-V2.6 的一部分训练过程放到了网上。
![]()
▲ 图:罗福莉发布 MiMo-V2.6 强化学习训练直播信息
这两条训练线分别对应 Pro 和 Flash 两个模型。当时,Pro 已经运行约 46 小时,Flash 约 42 小时。Pro 每小时约 2.06 万美元,Flash 每小时约 1.03 万美元,加在一起,一天就是约 74 万美元。
大模型训练果然烧钱。页面上的计数器,还在随着时间往上跳。
![]()
▲ 图:MiMo-V2.6 两条训练线的成本与进度中文重绘
这些钱到底花到哪里去了?
01 这不是从头训练,而是一次高强度“补课”
小米直播的是用强化学习(RL)进行后训练。模型已经具备语言、代码等基础能力,现在被放进不同环境里完成任务,再根据结果继续调整。
可以把预训练理解为读完大量教材。强化学习后训练更像把模型送进训练场,让它反复做题、操作工具、接受评分。
小米这次每轮会准备约 1,600 个任务,每个任务让模型尝试 16 次。一轮下来,就是约 2.5 万次尝试。
同一个任务做这么多遍,是因为 AI 每次选择的办法可能不同。
比如让 AI 修一个程序错误。有的尝试修好了问题,有的又弄坏了别的功能,还有的忙了半天也没找到原因。这个例子用来说明训练过程,并不是小米公开的一道具体题目。
系统会根据测试和评分结果调整模型,让它以后遇到类似情况时,更倾向于选择有效的做法。这不保证每次都成功,但会逐步改变它选择办法的倾向。
强化学习大致就是这样:尝试,接受反馈,再调整。
![]()
▲ 图:一轮强化学习训练中的任务、尝试轨迹与评分流程
一次尝试可能很长。根据看板中的数据,模型每次尝试往往要与工具、环境交互五六十轮:读信息,调用工具,检查结果,再根据反馈继续操作。这一连串操作与反馈,就叫一条“任务轨迹”。
图里还会看到 token 这个单位,可以把它理解成模型处理信息时使用的计量单位,不直接等于汉字数。
![]()
▲ 图:一条任务轨迹中反复进行的操作、检查与修正过程
训练期间,数万个隔离环境同时运行。可以粗略想象成,数万个临时工作间同时打开,每个里面都有一个 AI 在完成自己的任务。
按最近一轮的数据,两种模型各跑完一轮都要两三个小时,按看板费率估算,各自花掉几万美元。
大量长任务、重复尝试、工具操作和评分过程同时运行,成本就是这样堆起来的。
而且,这还只是看板里能看到的强化学习后训练成本,不是模型从零研发的全部账单。此前的数据准备、预训练,以及人员等其他研发投入,还要另外算。
02 超过三分之二的任务都在练代码
这块看板还回答了另一个很实际的问题:AI 到底在练什么?
具体题目没有公开,数据集名称也做了匿名处理。不过,从最近一轮的任务构成看,超过三分之二是代码任务,其余包括视觉、通用任务、网络安全和对话。
![]()
▲ 图:最近一轮 1,568 个训练任务的类别构成
结合前面那些连续操作,可以看出这轮训练很看重 AI 自己调用工具、完成一件事的能力。这也是人们常说的 Agent 能力。
不过,AI 要修程序,谁把代码交给它?它能用哪些工具?测试报错以后,谁把结果传回来?
这些事情,需要模型外面的一套软件来安排。页面里反复出现的 Harness,就可以粗略理解为这套“考场系统”。模型在里面做任务,系统负责组织过程,并连接测试和评分。
所以,训练 AI 还要搭考场、配工具、检查考场有没有出故障。模型说自己做完了不算数,还得经过检验。
看板列出了二十多种匿名 Harness,能看到各自进入训练的尝试数量和占比。不过,名字只写成 Harness A、B、C 等,外界还不知道它们具体对应哪些任务。
03 钱一直在花,成绩却不会一直涨
如果只看成本计数器,很容易产生一种错觉:算力一直增加,模型的能力也应该稳定向上。
看板里的曲线并不是这样。
以官方公布的 DeepSWE v1.1 编程评测为例,Flash 的成绩从约 49 分升到约 57 分,接着又掉回约 54 分。后面继续上升,但中间仍然多次回落。
Pro 也一样。它的阶段性成绩总体在提高,却不是每完成一步都比上一步更好。
![]()
▲ 图:Pro 与 Flash 在 DeepSWE v1.1 上的阶段性评测变化
一次评测分数的回落,不等于模型在所有事情上都变差了。不过,至少在这项测试里,多训练一步,并不保证成绩更高。
有时候问题甚至不在模型本身。
小米在看板中公开了两次运行事故。Pro 曾因为一台机器的显存出了问题而重启;Flash 则因为一类任务的运行系统出了错误,约 3 小时内没被正确识别,退回第 15 步重新运行。
![]()
▲ 图:官方看板公开的两条训练重启公告中文重绘
训练继续运行,钱继续增加,但其中也包含故障、检查和返工。这些不太漂亮的细节,反而让页面有了不同于产品发布会的价值。
04 为什么有人把它称为“RL 金矿”
页面的 Metrics(指标)栏目里,能看到每批任务的构成、操作轮数、成功率、耗时、系统故障等过程数据。
研究者可以把不同曲线放在一起看:AI 花更长时间处理任务时,成功率有没有变化?系统故障多的时候,有多少尝试被浪费了?不同任务进入训练的比例又是怎么调整的?
单看一条曲线不能证明原因,但这些过程数据能帮助他们提出问题、寻找线索。学习强化学习的人,也有机会对照真实训练记录,理解书里的概念在大规模运行时是什么样。
研究员 Nathan Lambert(@natolambert)把它称为目前公开过的、最酷的大规模强化学习资源之一。@arjunkocher 则说,这个页面对 RL 工程师是一座“金矿”。
elie(@eliebakouch)在转发中感叹,连每批任务的数据和测试框架构成都能看到。Sasha Rush(@srush_nlp)则开玩笑说,自己像赌徒盯盘一样,用手机盯着其中一个代码任务的回答长度。
成本也成了另一场围观。有人按页面数字计算每天和每个步骤的花费;Han Xiao(@hxiao)开玩笑说,页面很好、也很开放,只是别让 CFO(首席财务官)看见。
Lucas Beyer(@giffmana)则把注意力放到了算力上:帖子里所谓扩展计算、环境和评分,最后都离不开更多计算资源。即使把训练方法做得更好,运行这些任务和评分流程,依然要花钱。
![]()
▲ 图:相关公开转发中围绕透明度、研究价值、成本与算力的观点整理
05 它是一扇观察窗口,还不是完整教程
看板公开了大量过程数据,但具体题目、模型每一步的回答,以及完整的评分和训练方法尚未全部公开。外界可以观察变化,还不能仅凭这个页面复制同样的训练。罗福莉表示,团队会在接下来的几周陆续开源技术细节。
看完这场直播,至少能明白,AI 学会做事,要经历大量尝试,也要有能检查结果的工具和环境。尝试会失败,成绩会回落,系统还可能出故障。
看板上的钱一直在增加,模型却不保证每一步都进步。这也正是这场直播值得看下去的地方。
资料来源:
MiMo-V2.6 强化学习实时看板:https://mimo.xiaomi.com/rl/
罗福莉原帖:https://x.com/_LuoFuli/status/2100296686719610932
官方阶段性评测数据:https://mimo.xiaomi.com/rl/api/benchmarks
官方训练故障公告:https://mimo.xiaomi.com/rl/api/notices
说明:文中实时数据截取于 2026 年 9 月 17 日 16:49(北京时间),之后会继续变化。评论部分根据公开转发及用户整理的热门评论选取,中文均为意译,未采用持续变化的点赞量作为论据。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.