前几天刷X,刷到罗福莉发的一条帖子,说小米在直播MiMo-V2.6的后训练,训练步数、评测曲线、烧了多少钱,全都挂在一个网页上实时直播放出。我第一反应是这种发布模型的方式还挺有趣的,尤其是隔了两天又点进去,发现它还在跑,并且发现这模型训练也是真特么贵,2天就少了200万美元
![]()
差不多同一时间,发现海外做后训练的一圈人也在转这件事,AI2那位写RLHF书的说这是目前公开出来的at-scale RL资料里最酷的一份。
![]()
然后今天早上一睁眼,发现模型终于训完发布了。
![]()
Artificial Analysis的智能指数榜,MiMo-V2.6-Pro直接杀到了开源模型第一的位置,46分!上面那张图中虚线部分你可以理解为就是现在常见的所谓模型斩杀线:横轴是每个任务的成本,纵轴是智能指数——越靠近左上角越好,代表“能力更高、成本更低”。它落在绿色那块标着最划算的区域里,一个任务大概0.13美元。开源模型的斩杀线,又往上挪了一格。
六天,347万美元
直播结束了,后训练的费用确定了,Flash花了85万美元,Pro花了262万,每个模型跑了30个RL step,合起来347万美元,比我发帖那天又多烧了七成。罗福莉说这很可能是目前开源模型团队做过的、按算力算最大的单次RL训练之一,算力紧张成这样的时候,他们还是专门拉了几十个人去干这一件事。
![]()
那这三百多万美元到底买到了什么呢?
首先是现在大模型评测最看重的真实软件工程的Benchmark——DeepSWE v1.1:Pro从58.4涨到72.6,Flash从48.8涨到65.7,一个涨14分,一个涨17分。基座没换,全靠后训练。
![]()
去年DeepSeek发R1-0528那会儿我就说过,同一个基座跑分大涨,说明后训练里还有很多了不得的新认知没被挖完,小米这次算是又给了一个样本吧。而且这回连RL的代码、训练环境和技术报告一起开源了,你想复现可以自己去跑(如果你有300多万美元的话
我翻了技术报告的细节,想看看他们是怎么做训练的,他们把算力往三个方向堆:
一是batch拉大,每次更新1,568个样本,上下文拉到1M,每步吃3.5到3.7B的token;
二是任务拼成coding、通用agent、视觉和网络安全的混合套餐,在好几个harness里混着跑;
三是给打分器也加算力,同一组里做相对比较,逼着模型走更短的路、少花token。
跑分我一直的看法是,它是入场券,算是个可以参考的依据,但到底怎么样还是拿自己真实的任务测一测比较实在。
测试环境:MiMo Desktop
小米这次除了模型,还把MiMo Desktop的正式版一起发了,现在把V2.6-Pro和Flash直接内置进去。给自己的模型配一个自己的harness,这似乎是个显学了,大家都为了自己的效果做自己的harness,我自己这一年也在做。你手上要是同时装着好几家的coding agent客户端,会发现每家的系统提示词、工具集、上下文管理策略都不一样,同一个模型塞进不同的壳里,表现能差挺多。模型厂商自己调好的那套环境,大概最能代表它想让你看到的样子,所以这次测试、截图全在官方客户端里做,没走Claude Code。
![]()
然后我把自己平时用的四个skill装进了它的客户端:做程序化3D网页的huashu-3djs、操控真实浏览器的huashu-chrome、写研究报告的huashu-report,还有做设计的huashu-design。这四个都是我开源的东西,你读我公众号久一点应该都见过。拿它跑了五件活,全是多轮的、要来回迭代的那种,不做一句话出图那类one-shot。
案例1:3D建模能力
第一件测的是3D。GPT-6 Astra出来之后,用Blender渲染3D模型好像成了验证模型能力的新标准,小米的官宣里也放了Blender的case。不过除了操控Blender,现在模型直接用three.js写代码建模的能力也强了很多,我就拿这条路去考它,用的是我自己做程序化3D网页的skill。题目选太和殿,要求是先查公认尺寸、每个数写来源,审美参照故宫纪录片里正午的太和殿。
它真的先去查了。我随口写的「脊兽是十个,数量要对」,它翻资料发现有的来源把领头的骑凤仙人也算进去数成十一个,最后做了十个走兽、仙人单独放在端头。第一轮出来是这样:
![]()
说实话还有点像乐高,剪影和比例是对的,光打得很平。第二轮我让它加三层台基、丹陛和月台上的铜龟铜鹤。
下面这张环绕动图是我拿它的建筑包自己渲的,三角形从两万涨到54,646:
![]()
案例2:模型审美测试
第二件测的是前端审美,这两年国产模型追得最快的一项。题目是一家高端极地旅行社的官网首页,特意要求了:不要蓝色渐变加企鹅照片那种旅游站,要让人一眼觉得这家不一样。
我要求调用huashu-design skill之后,它给我出了三个版本。
第一版走包豪斯,圆、三角、方三个基本形当标志,深藏青配朱红,经纬度直接当版面元素:
![]()
第二版是原研哉那条路,大面留白,衬线中文,整页只有一句话,「把一生一次,留给真正的白。」
![]()
第三版是电影感,整屏一张冰山,「向南,直到世界安静下来。」
![]()
我自己最喜欢包豪斯那版。不过比风格更让我在意的是,三版没有一版带那种一眼AI的味道,这点我觉得比好不好看重要。
案例3:真实coding任务
第三件测的是真实coding场景下处理问题的能力,不是刷题。我开源的女娲skill仓库里有个用户9月8号报的bug,一直开着,所以我直接把仓库链接和issue编号丢了过去让Mimo-v2.6处理。
![]()
它读代码、找到地方、改完,大概5分钟之后,这个issue就处理完了。第3轮我让它拿仓库里15份真实的skill跑改前改后对比,基本上是稳稳把问题解决了。其实当一个项目复杂之后,一个新的模型,新的agent来接受算是最常见的我们日常做项目的场景,这种场景下是不是真能解决问题,我觉得是考验一个模型真实agentic编程能力的关键。
案例4:办公场景的数据处理
第四件测的是办公场景。最近的agent模型都在往work类的任务里走,做表、扒数据、核对,比写代码更贴近大多数人的日常。题目回到开头那个直播页:把两个模型逐step的数据整理成CSV,做成一页HTML数据页,最后回到直播页逐个数字核对。
它先看页面自己请求了哪些接口,直接读接口,60行一条不缺。核对那轮是我特意加的,想看它会不会替自己遮掩,它列出6处不一致并逐个改掉。改完是这样一页,数字和官方技术报告对得上:
![]()
有一件事是数据都出来之后我才意识到的:Flash花的钱只有Pro的三分之一,训练的token反而更多,涨得也更多,单看这一轮RL的投入产出,小模型那条线似乎更划算。
案例5:长程研究与幻觉控制
第五件测三样东西:长程任务、agentic过程里出了错它自己怎么处理、还有会不会编。研究对象我挑了Jev,TypeSafe AI 9月15号发的一个只做判断不输出文本的模型,发布在七天前,任何模型的训练数据里都不可能有它,编不编一查就知道。
错误处理是意外考出来的。我装在客户端里的两个搜索服务一个额度用光、一个密钥失效,内置联网搜索也没开,三条路全断。它试了两个都报错,转去用huashu-chrome操作真实浏览器读页面,前后四十来次检索把官方博客、文档、创始人署名文和团队页翻了一遍,五轮没有一次停下来问我怎么办。交出来的是一份十八页的机构研报:
![]()
编不编这项,它第一轮定计划时自己立了条规矩,没人要求:每个事实跟一个编号,只有对着原始页面核过原文的才能标已验证。我开跑前备了一份核查表,18条官方事实加五类最容易编的点。结果五类编造点零命中,18条命中14条,漏的都是细节。有一条反过来是我的表标错了,它引到了官方团队页的原文上。官方自己报的数它原样引、标明「官方自述,非独立测评」,发布才七天,外面本来就还没有第三方评测。
说说花销
上面测试的五个任务,一共跑了18轮,171分钟,全在官方客户端里,账是客户端自己记的:
![]()
有一个数我看了都挺惊讶的:输入token里95.7%是缓存命中。现在很多模型的缓存价格都远比未命中缓存的低,但是在实际用的时候,经常会遇到的问题是缓存命中率低,导致很多模型虽然看起来价格低,但是实际跑出来的价格比很多价格高,但是缓存做得好的模型贵多了。
所以,从我这次测试来看的话,MiMo-V2.6-Pro还真是又便宜,缓存命中率又高了,最近应该是可以把平时最常用的开源API转移到MiMo-V2.6-Pro和MiMo-V2.6-Flash上了。
![]()
最后
其实很难想象,大模型发展到这个阶段了,居然还能频繁给大家提供惊喜。上一周Jev给出了一种新的形态和一种新的价格,一个不写字只做判断的模型,输入每百万token四美分、输出免费;这一周MiMo-V2.6把开源模型的斩杀线又往上推了一格,一上午五件挺复杂的活花了九块钱。
两件事放一起看,智能这东西似乎真的在往普惠走,模型越来越强,价格倒是一路往下,你在自己电脑上开个客户端就能用上,账单跟一杯奶茶差不多。
江海之所以能为百谷王者,以其善下之。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.