网易首页 > 网易号 > 正文 申请入驻

OpenAI o1核心成员跳槽,首次公开397B模型的RL训练配方!

0
分享至

智猩猩AI整理

编辑: 没方

昨晚,LoRA 一作、前 OpenAI 研究员 Edward Hu在 X 上宣布,自己已经加入Mercor,负责模型训练与研究。

而他加入后的首批公开工作,就是把一套397B 参数开放模型的 Agent 强化学习训练配方完整摊了出来

从训练方法、工程细节到最终结果,团队不仅详细拆解了整个 RL 过程,还一并开源了训练脚本、模型权重以及评测 traces。


01

他是LoRA的一作,还参与

做出了OpenAI o1模型

Edward Hu 本科毕业于约翰·霍普金斯大学,之后前往 Mila 攻读计算机博士,导师是图灵奖得主Yoshua Bengio


他是LoRA 的第一作者

LoRA(Low-Rank Adaptation)是大模型参数高效微调最常见的方法之一。它冻结原模型参数,只训练额外加入的低秩矩阵,从而大幅降低大模型微调需要训练的参数量和显存。


2023 年,Edward Hu 暂停博士学业加入 OpenAI,参与构建o1模型,之后返回完成博士论文。


如今,他已经加入 Mercor,担任Head of AI Modeling


从 LoRA 到 OpenAI o1,再到如今的大规模强化学习,Edward Hu 的研究都是围绕“如何更高效地训练模型,并进一步提升模型的推理和学习能力”。

那为什么他的下一站会是 Mercor?

Edward Hu 在 X 上宣布加入 Mercor 时给出了自己的判断:随着前沿模型继续发展,高质量数据正成为模型完成高经济价值知识工作的关键瓶颈,而真正优质的数据,又必须和优秀的模型训练能力结合起来。

Mercor 恰好处在这两者的交汇点。

这家公司最早以 AI 人才匹配业务起家,由此积累了大量专业领域的人才与专家网络。近两年,Mercor 又组建了前沿研究团队 Mercor Research,开始将专家资源进一步转化为模型训练所需的高质量数据,并直接参与模型后训练和强化学习研究。

而 Edward Hu 加入后的第一项公开成果,正是沿着这条路线展开。

02

397B 模型的 RL

训练配方

这份指南来自 Mercor Research 与 SkyRL 团队的合作。

先看最终结果,在 Mercor 的 APEX-Agents 基准上,Qwen3.5-397B-A17B 的 Pass@1 从 16.11% 提升到 27.29%,相对提升约 70%;更小的 Qwen3.6-35B-A3B 经过 RL 后训练后,也在这一基准上超过了 Claude Opus 4.5。


相比已经被大量研究反复优化的 Coding Agent,专业知识工作是一个更难构造训练环境、同时也更加接近真实经济价值的场景。

这正是 Mercor 想切入的方向。

APEX-Agents 本身是一套包含 480 个公开测试任务的知识工作 Benchmark,覆盖管理咨询、投资银行和企业法务等领域。

与普通 Prompt Benchmark 不同,每个任务都存在于一个模拟企业环境中,里面包含大量 PDF、电子表格、Slides、聊天记录和邮件。Agent 必须通过 MCP 工具或者代码真正进入这个环境完成任务。

为了进行这次 RL 后训练,Mercor 又准备了 1928 个由专家创建的训练任务。它们与 APEX-Agents Benchmark 具有相同结构,但 Prompt 和模拟企业环境并不重合,以避免测试集污染。

而这篇指南最有意思的地方,就是团队把一次 397B Agentic RL 真正容易踩的坑几乎全部拆开讲了一遍。

(1)Harness等于练一个 epoch

在投入真正昂贵的 GPU 计算之前,首先必须把 Environment、Agent Harness 和 Token Accounting 搞对。

假设一个 Agent 工作了几十分钟,读完文档、打开 Excel、调用十几个工具,最后却因为 MCP 服务断开、Sandbox 超时或者 Tool 返回格式出错而得到 0 Reward。

对于普通 Agent 来说只是一次失败。放到 RL 里,却意味着几十万 Token 的 Rollout 和大量 GPU 时间直接被浪费,更麻烦的是,这些系统错误还可能反过来污染训练信号。

所以团队在真正训练之前,对整个 Harness 做了大量修补。

比如给文件下载、MCP 调用、容器关闭全部设置 Timeout;每个 Agent Loop 使用独立进程,避免大量并发 MCP 连接互相干扰;修复 PowerPoint Tool 成功执行后仍返回None的问题;PDF 多栏表格读取错误时,引导 Agent 改用pdfplumber

实验结果表明,仅优化 Harness 没有做任何训练,Qwen3.6-35B-A3B 的 Mean Reward 就从 22.74% 上涨到 28.69%。团队表示,这个提升幅度大约相当于在原 Harness 上训练完整一个 Epoch


另一个重点则是TITO(Token-In-Token-Out)

长程 Agent 会经历大量交互。如果模型输出先转成文本,再由 Harness 重新 Tokenize,得到的 Token ID 可能与 Rollout 时并不一致,导致 Trainer 实际训练在模型从未采样过的 Token 序列上,使 RL 悄悄Off-policy

团队选择保留模型实际生成的 Token ID,避免反复 decode → re-tokenize,从而减少 Rollout 与 Trainer 之间的 Token 偏差,让 Agent Harness 更适合强化学习训练。

(2)35B 先试错,再把配方放大到 397B

解决系统问题之后,团队只取32 个任务,检查模型能不能迅速把它们学会。如果连 32 个任务都过拟合不了,直接跑一次大规模实验,基本就是白烧 GPU了。

而这一步还真的发现了问题。

团队发现,那些依赖 rollout 前后文件差异进行评分的任务,明显比只看最终回答的任务更难学。顺着这个现象检查后,他们发现问题出在 Grader 的文件比较逻辑上。在换用第三方 File Diff 工具、提高文件提取和比较的准确性后,这些任务才开始表现出清晰的学习信号。

确认整个 Pipeline 没问题后,他们先用 35B 模型做各种算法消融实验。

其中一个非常重要的发现是,长程 Agent RL 如果直接按所有 Token 做全局平均,长轨迹会天然主导梯度。

因此,团队改用 prompt_mean,让不同 rollout group 先获得相同权重,再在每组内部平均 Token Loss。这一项改动,就让结果增加了3.9 个百分点

另外一个技巧是,当 Agent 已经消耗掉 80% Context 时,Harness 会提醒一句“该收尾了

这个 Context Nudge 能减少 Agent 因 Context 爆掉而整个 Rollout 得到零分的情况,仅训练阶段加入这一机制,增加了3.0 个点

最终团队确定的组合是:DPPO + prompt_mean + Context Nudge


随后才启动397B 模型训练

(3)397B 的 Agentic RL 到底怎么跑起来?

Agentic RL 中,一部分 GPU 要负责 Rollout,让模型进入环境跑任务。另一部分 GPU 则负责 Trainer,根据 Reward 更新参数。

如果 Rollout 太慢,Trainer 就得等数据。如果训练太慢,大量生成出来的 Trajectory 又会因为 Policy 已经更新而变得过旧。


如下图所示,团队采用SkyRL + vLLM + Megatron构建 Fully Async RL 训练栈,并基于 Ray 调度分布式任务。每个 Agent Trial 则由 Harbor 管理独立沙箱环境。


团队在 35B 实验中将推理与训练节点比例设置为4:2,到了 397B 则扩展为12:8。与此同时,35B 模型最多同时运行约550 条 Rollout,397B 模型则设置为300 条并发 Rollout

为什么模型更大,并发反而下降?

瓶颈之一就是KV Cache。这些任务一次 Trajectory 动辄数万乃至十几万 Token,单个 Agent 占用的 KV Cache 非常大,因此真实系统能够承载多少并发 Agent,很快会被显存限制。

可以看出,大规模 Agentic RL 到最后已经不只是一个“选什么 RL 算法”的问题。它同时是一个分布式训练、推理吞吐、KV Cache、Agent Runtime 和环境基础设施问题

(4)换掉 Harness,RL 增益还在

RL 训练还有一个问题:模型学到的能力,会不会绑定在训练时使用的 Agent Harness 上?

团队专门测试了这一点。训练时,模型使用基于 MCP 的 Archipelago Harness;评测时则完全换成代码型 OpenCode,不再提供任何 MCP Server,只开放 bash、grep、read、write、edit 等代码和文件工具。

结果显示,RL 带来的大部分性能增益仍然能够跨 Harness 保留下来

团队进一步把任务也换掉,在从未用于 RL 训练的 Terminal-Bench 2.1 上评测,模型同样获得提升。这说明模型学到的不只是 APEX-Agents 或 Archipelago 的固定工作流,而具有一定的跨 Harness、跨任务泛化能力。


与此同时,团队在 HLE 和 GPQA 上也没有观察到明显退化,说明 Agent 能力提升并未以牺牲通用推理能力为代价。


03

算法选择的重要性,

可能没有数据本身那么大

团队比较了五类算法和训练技巧后发现,效果最好的单项改动,也只带来了 3.9 个点的提升。但整套 Post-training 做完后,两个模型都提高了大约 10~12 个百分点。

因此,Edward Hu 团队给出了两个很明确的判断。

首先,算法选择的重要性,可能没有数据本身那么大。

Coding Agent 之所以率先跑通 RL,很大程度上就是因为代码天然拥有大量可执行、可验证的数据。如果 AI 要真正接管咨询、金融、法律、科研这些知识工作,真正稀缺的是把真实工作拆成环境、任务、工具、轨迹和可靠 Reward 的高质量数据。

其次,这些 RL 增益并没有被锁死在某一个 Agent Harness 里

一个经过 Post-training 的开源模型,更像是一个可以复用的能力资产,而不是“焊死”在某套 Agent Scaffold 上的专用模型。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
赛力斯分家,车主破防,小米订单暴涨635%:华为该不该自己造车

赛力斯分家,车主破防,小米订单暴涨635%:华为该不该自己造车

王新喜
2026-09-16 13:36:57
幸好!如果当初决策层相信了许小年,中国可能会比现在落后二十年

幸好!如果当初决策层相信了许小年,中国可能会比现在落后二十年

叮当当科技
2026-09-17 05:00:02
“罗永浩说野人先生难吃”冲上热搜,店员回应:不知道罗永浩是谁,价格偏贵应该是品牌的定义

“罗永浩说野人先生难吃”冲上热搜,店员回应:不知道罗永浩是谁,价格偏贵应该是品牌的定义

极目新闻
2026-09-15 12:16:02
林彪为何多次探望远离政治的贺子珍?孔东梅:恐怕只有一个原因

林彪为何多次探望远离政治的贺子珍?孔东梅:恐怕只有一个原因

小豫讲故事
2026-09-14 00:15:07
9月16日最新消息,盼了许久的 2026 退休养老金,到底还会不会涨?

9月16日最新消息,盼了许久的 2026 退休养老金,到底还会不会涨?

笑熬浆糊111
2026-09-17 08:06:08
64岁李瑞英近况曝光!嫁给学者张宇燕育有一子,如今气质优雅生活幸福

64岁李瑞英近况曝光!嫁给学者张宇燕育有一子,如今气质优雅生活幸福

代军哥哥谈娱乐
2026-09-16 09:14:25
不出所料,上海房价已经压不住了

不出所料,上海房价已经压不住了

金刀说房
2026-09-17 07:30:12
纪实:小三为专升本,穿私密内衣上门勾引老师,原配上门对峙却被气到流产

纪实:小三为专升本,穿私密内衣上门勾引老师,原配上门对峙却被气到流产

小徐讲八卦
2026-09-17 08:17:41
宪法规定:中国公民享有人身自由权利。

宪法规定:中国公民享有人身自由权利。

abc350514
2026-09-13 16:14:58
让六小龄童来教张一山演“孙悟空”的人,可是个天才!

让六小龄童来教张一山演“孙悟空”的人,可是个天才!

八卦南风
2026-09-16 17:22:15
群体性无知正在主导当代舆论

群体性无知正在主导当代舆论

浪子说
2026-09-15 07:05:21
中南大学湘雅医学院“感人”教授为何敢公然造假?

中南大学湘雅医学院“感人”教授为何敢公然造假?

关尔东
2026-09-16 23:52:54
3000万元房产要拆迁,女子意外发现丈夫有16岁私生子,马上立遗嘱为女儿守财,女儿:由于重男轻女,父亲一直希望有个儿子

3000万元房产要拆迁,女子意外发现丈夫有16岁私生子,马上立遗嘱为女儿守财,女儿:由于重男轻女,父亲一直希望有个儿子

台州交通广播
2026-09-17 01:30:40
1962年,甘肃常务副省长王秉祥,因拒绝枪毙13位县委书记被撤职,复出后升任省委书记

1962年,甘肃常务副省长王秉祥,因拒绝枪毙13位县委书记被撤职,复出后升任省委书记

方圆文史
2026-09-14 17:29:50
央视曝光“夺命毒衣服”,致癌物超标20多倍!这4种衣服谨慎购买

央视曝光“夺命毒衣服”,致癌物超标20多倍!这4种衣服谨慎购买

39健康网
2026-09-16 09:05:47
当场掀桌子?美专家逼台湾打仗,台军退役军官一句话怼到差点动手

当场掀桌子?美专家逼台湾打仗,台军退役军官一句话怼到差点动手

北海史记
2026-09-16 10:59:11
正规的几乎都关了,“黑户”拿命冒险

正规的几乎都关了,“黑户”拿命冒险

中国新闻周刊
2026-09-17 07:24:25
房价:大家不用等了,不出意外,房价将会重演历史

房价:大家不用等了,不出意外,房价将会重演历史

童童聊娱乐啊
2026-09-16 16:18:53
经国务院批准,中秋全国放假时间,来了

经国务院批准,中秋全国放假时间,来了

时尚的弄潮
2026-09-16 15:50:07
演员贾乃亮已多年没作品,本人回应:因为无戏可拍,而且面临一个尴尬的问题……

演员贾乃亮已多年没作品,本人回应:因为无戏可拍,而且面临一个尴尬的问题……

东方不败然多多
2026-09-16 11:31:28
2026-09-17 11:27:00
智猩猩
智猩猩
AI 技术内容与服务平台
127文章数 5关注度
往期回顾 全部

科技要闻

赛力斯全面接盘,华为真的“撤”了吗?

头条要闻

牛弹琴:印巴军舰茫茫大海上罕见相撞 有三个疑点

头条要闻

牛弹琴:印巴军舰茫茫大海上罕见相撞 有三个疑点

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

比起敬一丹的退而不休 章伟秋更显明智

财经要闻

美联储加息!沃什重磅发声

汽车要闻

激光雷达+EVA机器人+爆胎稳行 星瑞L PLUS预售限时价11.57万起

态度原创

房产
时尚
本地
健康
军事航空

房产要闻

突发!三亚安居房出台新政!

8年没换过|| 每次“垮脸”都靠它救,这笔小投资已值回本

本地新闻

不止胖东来!许昌藏着半部三国史

亲属查出脑动脉瘤?你也尽快筛查!

军事要闻

中东美军基地遭伊朗袭击后照片被披露

无障碍浏览 进入关怀版