网易首页 > 网易号 > 正文 申请入驻

做一个能自迭代的后训练平台,Mind Lab要让更多企业拥有自己的模型

0
分享至

文|王欣逸

编辑|张雨忻

如果你近期有和投资人闲聊两句,会得出这样一个结论:AI圈的关注点再一次回到了模型和AI Infra(基础设施)。模型,对应着时下应用遇冷,热度向上游转移;而AI Infra的关注点之一,是后训练平台和推理平台。

昨天,Mind Lab发布了他们的最新成果:推出面向行业的模型后训练与推理平台Mint Recursive,以及基于这一平台做后训练的模型Macaron-V1.1。

Macaron-V1.1是一个基于GLM-5.3做后训练、参数为752B的模型。7月,Mind Lab创始人陈锴杰告诉我们,从基于GLM-5.1后训练的Macaron-V1-Preview到基于GLM-5.2的Macaron-V1,中间只隔了不到一个月。而迭代还在加速,据了解,Macaron-V1.1从上一代迭代而来仅用了不到两周。

Macaron-V1.1由744B的基座模型和四个2B的LoRA专家模块组成,其中四个LoRA分别负责Chat、Agent、Coding和Generative UI(生成式UI)。

从V1的1B LoRA变成了现在的2B LoRA,他们也正在摸索更为理想的专家参数规模。从Benchmark结果来看,相比V1,V1.1在6个Agent榜单上全面提升,在SWE-Marathon(超长程AI编程能力)表现尤为出色。。


△Macaron-V1.1 benchmark表现,来源:企业

更值得注意的是,Macaron V1.1完全基于Mint Recursive完成训练。

Mint Recursive是一个后训练与推理平台,其工作流程包括测评、数据、后训练与部署推理,用户通过API和Python SDK即可调用平台的训练和部署能力;还能接入生产环境中的反馈,让模型在真实任务中持续改进。而这套流程,Mint Recursive 在Macaron V1.1模型的迭代上已经跑通。

就在这一节点,Mind Lab集中发布了一系列成果,把过去一段时间在持续学习与Infra领域积累的Know-how,沉淀为一套可对外提供的服务。

做后训练的Infra

Mind Lab一边做模型、一边做Infra,这并不让人意外。

在今年1月,他们就率先推出了Mint Recursive的早期形态——一个关于LoRA训推的基础设施平台,为客户提供大模型后训练全流程解决方案。

与此同时,在Infra层面下功夫,正慢慢成为一个行业共识。

几天前,智谱创始人、首席科学家唐杰在X上发了一篇长文,阐述了他们用AI改进AI的最新进展,他们让GLM-5.3驱动的Infra Agent,自动优化GLM-5.3自己的推理引擎,让一个超10万张国产芯片组成的集群,在不到两周的时间里,将端到端吞吐提升至初始基线的3倍。

智谱正在做的就是让AI去自我改进推理层Infra。同样是模型参与优化自己,大家想解决的问题不同——Mind Lab要做一个后训练平台,想优化的是从整个后训练到部署推理的流程,囊括数据、评测、部署、反馈收集等步骤。

Mint Recursive平台由三大模块组成:Train&Deploy(训练与部署)、Env Hub(环境中心)、Data&Experience(数据与经验)。这一平台支持模型、SFT(监督微调)、RL(强化学习)、DPO(偏好训练)、全参微调等算法,兼容GLM、Qwen、DeepSeek、Kimi、MiniMax等多种尺寸的开源模型;训练完成后可一键部署,还有配套的测评体系,为下一轮模型训练做准备。

去年9月,OpenAI前CTO Mira Murati创办的Thinking Machines Lab发布了一篇名为《LoRA Without Regret》的技术博客,从理论和实验上证明了,只要方法得当,LoRA的效果可以比肩全参数微调。从那以后,LoRA几乎成了后训练领域的普遍采用的方案。

值得一提的是,Mind Lab一直关注“LoRA”这一后训练范式,这次他们也在这条路线上更进一步,在Mint Recursive中,他们用LoRA把训练和部署都做成了Serverless(无服务器)的模式:客户无需自己买GPU、管理集群,可以直接按Token用量计费。

在训练侧,Mint Recursive想实现的是让模型更聪明——用LoRA的方式,只训练一些少量的新增参数,根据业务目标,不断从业务反馈中学习、持续迭代能力,让模型变得更懂业务,与此同时,还能显著降低企业后训练的开销。

在部署侧,4个LoRA专家模块对应的4个业务版本各自是一个轻量级的Adapter(外挂插件),挂在同一个基座模型上。这些Adapter互不干扰、非常灵活,每个Adapter都能单独升级、上线与下线,历史版本也保留着,便于客户对照与回滚。客户也可以把某个Adapter合并到基座模型里,变成一个完整的、独立的模型。

这也正是LoRA的核心思路,共用基座模型,在每个业务场景只做针对性的后训练。好处在于,模型后训练、部署与迭代的成本能实现大幅下降,调整权重也更加灵活。

后训练所需的数据、评测、反馈等,每一步都离不开Infra的支撑。从做后训练到做后训练Infra,Mind Lab的选择很自然。

但在交出Mint Recursive答卷之前,他们也能做了很多准备:

2025年,Mind Lab开始在Kimi K2这样的万亿参数模型上做后训练研究,Mint Recursive的基础设施最早也是那时开始搭的;

随后,2025年底,他们向NVIDIA Megatron-Bridge贡献了业界首个1T参数量级的LoRA-RL,为Megatron补充了面向超大规模基座的轻量化强化学习的经验;

2026年中,参与火山引擎的强化学习训练框架veRL、NVDIA的下一代训练后端megatron_lite等多个开源项目,提供了一些LoRA和强化学习解决方案;

2026年7月,Macaron-V1系列正式发布并开源,验证了这套训练方案在Agent、Coding等任务中的有效性。

Infra很重要,但不是所有公司都能做Infra,以及有必要单独做Infra。

万亿模型的后训练,工程难度远超想象。分布式训练的显存调度、训推一致性的精度对齐、异步RL的权重热更新,对于一家创业公司而言,每一块都是硬骨头。

陈锴杰告诉我们,训练小模型的强化学习其实很容易,但是一旦规模上来了,难度会变得非常大,尤其是他们还在强化学习之上,叠加了LoRA的持续学习训练方法。

目前,Mint Recursive主要提供三种服务:类似FDE形式的专家与企业一起完成训练;依托平台进行自动化训练;企业通过API和Python SDK自主训练。

训一个企业自己的模型

越来越多企业想要拥有自己的模型,这也是轻量的后训练、持续学习的训练范式被推崇的原因。

从落地角度看,企业端或许是定制化模型最为迫切的场景。“通用大模型仅能覆盖各行业20%-30%的场景,剩下70%-80%的部分,都需要垂直持续学习来优化。”陈锴杰提到。

海外市场已经先一步验证了这个趋势。Fireworks AI,一家做开源模型推理和后训练托管的硅谷公司,今年7月,其估值已经达到175亿美元,ARR突破10亿美元,日Token处理量超过40万亿。

Fireworks AI CEO乔琳在和红杉的对谈中提到:“后训练已经不是模型团队专属游戏了,AI产品在找到PMF、开始规模化后,后训练几乎是它们绕不开的一门必修课。”

具体来看,相比于模型厂商,AI产品公司的壁垒在于用户真实使用产生的数据、真实任务、反馈与偏好等。Fireworks平台上95%以上的流量,来自客户自己微调的专用模型,而不是通用基座。这一逻辑,被乔琳定义为“拥有自己的智能”。

“应用公司做模型”这一选择,正发生在越来越多的企业身上——AI应用的竞争点从产品本身,逐渐变成产品的经验智能,包括自己的判断、Taste、业务数据和对客户的理解等方面。

应用公司最独特的资产来自真实生产环境:它知道用户究竟想完成什么、哪些结果算好、哪里反复失败,以及专业人员真正怎样判断结果。如何让企业拥有自己的智能、把行业经验合并进基座模型中?

Mint Recursive在尝试的就是让企业建立起自己的评测体系、奖励机制、训练数据,把后训练做成一个持续迭代的闭环:模型在服务用户后积累下真实任务场景数据,每次交互的轨迹,无论成功还是失败,都会被完整记录下来。

这其中,失败的轨迹相当有价值,哪里做错了、为什么错、应该怎么改,平台在找到问题和解决方法后,这些判断和轨迹会直接变成新的训练数据;用新数据重新训练完上线后,又会产生新的反馈,新的反馈又变成下一轮训练的输入,如此循环往复。

平台中的Env Hub(环境)环节容易被忽略,但它尤其关键。英伟达的一篇Agentic RL技术博客中提到,做Agent强化学习需要环境来定义数据集、验证器和状态。环境不只是模型的训练场,也是评测场,评测、合成数据、强化学习,都可以在一套环境中完成。

尽管Mint Recursive中的Recursive(递归)还处于初级形态——人依然在递归的回路中,离模型全自动自己训练还比较遥远,但模型迭代方向已经很明确了。对客户而言,更为重要的不是模型本身,而是企业手里的一线业务现场与独一无二的真实业务数据。

图片来源|企业供图

欢迎交流~

本文来自微信公众号“智能涌现”,作者:王欣逸,36氪经授权发布。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
歌手潘玮柏公布病情

歌手潘玮柏公布病情

半岛晨报
2026-09-23 11:03:21
理想小米带头“去宁德化”,车企集体掀桌子不是因为价格

理想小米带头“去宁德化”,车企集体掀桌子不是因为价格

许穋很机智
2026-09-22 16:57:29
身高硬伤!佐藤淑乃:输给中国女排十分恼火与不甘心,太过忌惮对手的拦网

身高硬伤!佐藤淑乃:输给中国女排十分恼火与不甘心,太过忌惮对手的拦网

生活新鲜市
2026-09-23 08:07:04
决胜局轰21-9!男双新组合立功,国羽男团3-1淘汰印度,会师印尼争冠!

决胜局轰21-9!男双新组合立功,国羽男团3-1淘汰印度,会师印尼争冠!

刘姚尧的文字城堡
2026-09-23 19:06:45
西媒:卡塞米罗的电竞战队持续亏损,2025年录得亏损202374欧元

西媒:卡塞米罗的电竞战队持续亏损,2025年录得亏损202374欧元

画夕
2026-09-22 14:55:06
亚运男足黄牌情况:王钰栋下场停赛,5人有停赛风险

亚运男足黄牌情况:王钰栋下场停赛,5人有停赛风险

懂球帝
2026-09-23 16:17:05
数据炸了:中国电动车每天省150万桶石油!印度和越南要急眼了

数据炸了:中国电动车每天省150万桶石油!印度和越南要急眼了

云居历史
2026-09-22 18:45:30
调查发现:只要空腹血糖没超这个值,该吃吃该喝喝,不用太担忧?

调查发现:只要空腹血糖没超这个值,该吃吃该喝喝,不用太担忧?

医学科普汇
2026-09-23 18:20:09
吃了20年肉,才知道“盐水煮”最香!低脂又健康,肉鲜嫩还不腥!

吃了20年肉,才知道“盐水煮”最香!低脂又健康,肉鲜嫩还不腥!

思思夜话
2026-09-22 13:44:16
朝鲜缺电远比越南严重,中国却始终不向其送电,说白了,一旦输电线搭过去,恐怕会送出个无底洞般的烂账

朝鲜缺电远比越南严重,中国却始终不向其送电,说白了,一旦输电线搭过去,恐怕会送出个无底洞般的烂账

人生录
2026-08-13 00:05:10
北控男篮30分惨败,主教练被驱逐,库克30+5邹雨宸16+4,贾尔斯态度消极

北控男篮30分惨败,主教练被驱逐,库克30+5邹雨宸16+4,贾尔斯态度消极

中国篮坛快讯
2026-09-23 21:40:44
辛迪·克劳馥独子猝逝内幕曝光:尸检已完成,父母状态完全失控

辛迪·克劳馥独子猝逝内幕曝光:尸检已完成,父母状态完全失控

新时代精神
2026-09-23 00:30:01
A股:不必等待了,尾盘传来两个信息,明天,周四或要这样走!

A股:不必等待了,尾盘传来两个信息,明天,周四或要这样走!

明心
2026-09-23 15:50:39
湖北男子在陕西捡到奇石,发现外形酷似朱元璋“鞋拔子脸”,得知朱元璋其实不长这样后,仍决定定制配套底座珍藏

湖北男子在陕西捡到奇石,发现外形酷似朱元璋“鞋拔子脸”,得知朱元璋其实不长这样后,仍决定定制配套底座珍藏

极目新闻
2026-09-23 17:57:24
孙杨也没想到,自己保持了13年的记录,被18岁的张展硕打破了

孙杨也没想到,自己保持了13年的记录,被18岁的张展硕打破了

小琴动漫
2026-09-22 18:04:59
胡蝶与戴笠的真实样貌:并非演员扮演,而是货真价实的罕见历史照片

胡蝶与戴笠的真实样貌:并非演员扮演,而是货真价实的罕见历史照片

明月清风阁
2026-09-22 14:25:13
王小玮舞台丝袜造型太绝!久违亮相,这腿还是那么能打!

王小玮舞台丝袜造型太绝!久违亮相,这腿还是那么能打!

阿废冷眼观察所
2026-09-22 15:14:37
央美教授画“红领巾小孩”被骂上热搜!网友:这审美我真的看不懂

央美教授画“红领巾小孩”被骂上热搜!网友:这审美我真的看不懂

西楼知趣杂谈
2026-09-20 11:00:05
看人很简单,看衣服就够了,能深交的人,穿衣都有这3个特点

看人很简单,看衣服就够了,能深交的人,穿衣都有这3个特点

风起见你
2026-09-23 10:24:00
小米新模型登顶开源榜,训练成本仅262万美元

小米新模型登顶开源榜,训练成本仅262万美元

碳基打工人
2026-09-22 20:13:10
2026-09-23 22:03:00
36氪 incentive-icons
36氪
让一部分人先看到未来
152615文章数 2849373关注度
往期回顾 全部

科技要闻

网易未来大会圆满落幕 硅基智能跨越临界点

头条要闻

女子骑车被30余厘米长竹棍贯穿脖颈 丈夫跪地哭求救命

头条要闻

女子骑车被30余厘米长竹棍贯穿脖颈 丈夫跪地哭求救命

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

焕新价17.78万起 长城猛龙PLUS力魂版与Hi4 255 Ultra上市

态度原创

亲子
艺术
教育
本地
公开课

亲子要闻

离职举报“炒菜锅洗拖把”,良心老师不该没有前程 | 新京报快评

艺术要闻

深圳4座新全球总部:大疆尖塔、京东画境、OPPO曲面、科达利窗口

教育要闻

不订奶就站着喝水?

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版