网易首页 > 网易号 > 正文 申请入驻

RSIAgent:开源 Kimi-K3 反超 GPT-6

0
分享至

一句话总结:当所有人还在用"参数越大越强"的旧逻辑训模型,Aether AI 给出了第三条路——让 Agent 在真实环境里自己探索、试错、沉淀经验,0 个权重更新就让 Kimi-K3 和 GLM-5.3 在 OSWorld 2.0 和 Agent's Last Exam 上反超 GPT-6 Astra 和 Claude Opus 5。
为什么这篇值得写?

过去三年,AI 圈的所有发布会基本都遵循同一个公式——更大的参数、更长的训练、更贵的算力。Scaling Law 成了信仰:参数 ×10,能力就涨一波。

但 2026 年 9 月 14 日,arXiv 上挂出的论文《RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments》(2609.15364v1),把这套信仰翻了一面:

指标RSIAgent 之前的 GLM-5.3RSIAgent 之后的 GLM-5.3GPT-6 AstraClaude Opus 5OSWorld 2.0 (0808 offline)71.97%78.98%72.60%—Agent's Last Exam (Near-term)84.82%82.26%—

关键差异:RSIAgent 没改一行模型参数。它只让 Agent 自己在真实软件里点来点去、把"踩过的坑"沉淀成可复用的 Memory,结果开源 Kimi-K3 / GLM-5.3 直接把闭源旗舰 GPT-6 Astra 推下了榜首。

这就是今天所有人都在讨论的第三条 Scaling 路径——Scale Experience(规模化经验),而不是 Scale Model。

先看图:3 句话读懂 RSIAgent



RSIAgent 把"训练-部署"两段式拆成一条持续进化的流水线:

  1. 1.三 Agent 闭环——Curriculum Agent 决定下一步探索什么,Actor Agent 真去操作,Verifier Agent 校验结果;
  2. 2.两阶段探索——先 Broad(并行广撒网)把环境结构画出来,再 Deep(顺序深挖)专挑硬骨头;
  3. 3.冻结记忆——所有经验沉淀进 Memory 后冻结,下游任务直接复用,模型参数一行不动
它到底是什么?

RSIAgent 是一套训练免费的多智能体递归自我改进框架,由 Aether AI 团队(Sibo Zhu、Shicheng Fan、Xinyue Wang 等)在 2026 年 9 月 14 日发布。论文 + 代码 + 网站三件套全开源:

  • • 论文:https://arxiv.org/abs/2609.15364
  • • 代码:https://github.com/AetherLabsAI/RSIAgent
  • • 网站:https://aetherlabsai.github.io/RSIAgent/

它解决的是 Agent 落地最痛的问题——"模型再聪明,遇到没见过的软件也抓瞎"

任何企业内网、私有 CRM、自研管理后台,对模型来说都是"陌生环境"。传统做法是换模型 → 换更大的模型 → 重新训。RSIAgent 换了个思路:模型不动,让 Agent 在目标环境里自己爬一遍

核心机制:三个 Agent + 两阶段探索



RSIAgent 不是单 Agent,而是把工作切成三种角色

角色职责类比Curriculum Agent决定下一步该探索什么方向新人 PM,每天给实习生派活Actor Agent真·点开软件、敲代码、抓 DOM手速担当的执行者Verifier Agent校验 Actor 的结果是否真发生毒舌 QA,对照截图/日志/状态码

三 Agent 围绕一个不断演化的 Memory闭环协作:生成任务 → 动手折腾 → 验证结果 → 沉淀经验 → 升级任务。

而探索分两阶段,像极了人类训练 AI 的两步——

第一阶段:Broad Recursive Self-exploration(广域探索)

类似 Pre-training:并行跑 10 个不同方向的任务——试工具、换输入、改权限、切浏览器——快速画出"这个系统大致长啥样"的拓扑图。

第二阶段:Deep Recursive Self-exploration(深度攻坚)

类似 Post-training:专门设计"边界压测题",专挑系统最脆弱的神经末梢下手。

消融实验证实:移除任一阶段,效果都会大打折扣。RSIAgent 真正在重新定义什么叫"扎实的基本功"。

数据说话:开源怎么反超闭源



基准GLM-5.3 基线GLM-5.3 + RSIAgentGPT-6 AstraClaude Opus 5提升幅度OSWorld 2.0 (0808)71.97%78.98%72.60%落后+7.01 ptsAgent's Last Exam (Near)84.82%82.26%落后+2.56 pts

更夸张的是游戏开发场景(GameCraft-Bench):一些初始成功率只有 0–40% 的任务,经过多轮 RSI 探索后直接拉满到 100%

而这一切——没有任何一次反向传播,没有任何一次梯度下降

关键反常识:能力到底藏在哪里?



过去我们默认"能力藏在参数里"。RSIAgent 给出的答案是——能力藏在环境知识里

一个没去过故宫的导游,背再多地理书也讲不出承乾宫的飞檐翘角;但一个去过 10 次的导游,一开口就是"你看这个斗拱是明代官式做法"。

Kimi-K3 和 GLM-5.3 是那个"没去过故宫"的导游;RSIAgent 给它们的是一份已经踩过坑的"故宫地图"

代价是什么?几乎为零——没有额外训练成本,没有额外数据标注,模型权重一字不改。

三种场景,谁该立刻用 RSIAgent?场景 1:企业内部 Agent 落地

数据不能出内网、系统月月迭代、自研工具没有公开训练数据——RSIAgent 是天然解。让 Agent 在你自己的后台里爬一周,把"隐藏的输入校验、异步状态、失败重试路径"全沉淀进 Memory。

场景 2:模型选型受限于"开源生态"

买不起 GPT-6?无所谓。RSIAgent + Kimi-K3 / GLM-5.3 已经能跑赢它。省下的不只是 token 钱,还有合规和私有化部署的复杂度

场景 3:研究 Agent Scaling 范式

"到底是 Scale Model 还是 Scale Experience?"——RSIAgent 给出的答案是两者可以叠加。下一步问题是:能不能用 RSI 找到新 Scaling 律?

三件需要冷静的事

  1. 1.Memory 会过期:论文没说"环境改了 Memory 怎么更新"。如果你的 UI 每周发版一次,Memory 到周四就过期了——必须配套自动检测 / 重新探索机制。
  2. 2.Verifier 也会被骗:如果 Verifier 自己没看清真实环境变化(DOM 误判、状态码漏检),错的经验也会写进 Memory。建议对 Memory 做外部交叉验证。
  3. 3.不是万能银弹:RSIAgent 解决的是"在新环境快速上手",不是"生成新能力"。模型本身的能力上限还在;但同一能力在不同环境下的落地效率,可以靠 RSI 大幅提升。
一张表带走所有信号



维度关键信号核心反常识训练免费、不更参数,开源模型反超闭源旗舰三 Agent 闭环Curriculum + Actor + Verifier 围绕演化 Memory两阶段策略Broad Recursive Self-exploration → Deep Recursive Self-exploration关键数字OSWorld 2.0: 71.97% → 78.98%(+7.01);Agent's Last Exam: 84.82%核心价值0 训练成本、0 数据标注、模型权重一字不改适用场景企业内 Agent / 私有化部署 / 模型选型注意事项Memory 过期检测 / Verifier 误判漏检 / 非万能银弹

重点回顾

  1. 1.RSIAgent 给出第三条 Scaling 路径:Scale Experience,而不是 Scale Model。开源 Kimi-K3 + GLM-5.3 用 RSI 在 OSWorld 2.0 从 71.97% 提到 78.98%,反超 GPT-6 Astra 的 72.60%。
  2. 2.三 Agent 闭环 + 两阶段策略:Curriculum / Actor / Verifier 持续迭代,Broad → Deep 一遍比一遍更深;Memory 冻结后下游任务直接复用。
  3. 3.0 训练成本、0 数据标注:所有经验都从真实环境里自己"踩坑"沉淀,对企业内 Agent 落地和私有化部署尤其友好。
  4. 4.核心反常识:能力不在参数里,在环境知识里。一个去过 10 次故宫的导游,比背 100 本书的导游讲得更生动。
  5. 5.Memory 会过期——这是 RSIAgent 当前最大盲区,下一步要解决自动检测 + 自动重新探索。
  • • 论文:https://arxiv.org/abs/2609.15364
  • • 代码:https://github.com/AetherLabsAI/RSIAgent
  • • 网站:https://aetherlabsai.github.io/RSIAgent/
  • • 中文解读:51CTO《在多项高难度 Benchmark 超越 GPT-6 Astra,RSIAgent 让开源模型自主探索新环境》
  • • 团队主页:Aether AI 因果智能路线(Causal-Copilot / C-World / Auto-scaling Continuous Memory)

作者:科技爆款捕手 · 2026-09-16信源:arXiv 2609.15364v1 / 51CTO / AGI Hunt / 搜狐科技 / Aether AI 官方

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1982年:多次生育对母体有害;2024年:生育能帮女性防病

1982年:多次生育对母体有害;2024年:生育能帮女性防病

就一点
2026-09-15 22:58:38
“一个月陪睡一两次”:网红魏莹的榜一大哥照片曝光,他身价过亿,是个大企业家

“一个月陪睡一两次”:网红魏莹的榜一大哥照片曝光,他身价过亿,是个大企业家

江山挥笔
2026-08-25 16:40:36
普京如今是真想通了!哪怕砸锅卖铁,也要把中国想要的东西凑出来

普京如今是真想通了!哪怕砸锅卖铁,也要把中国想要的东西凑出来

王姐懒人家常菜
2026-09-16 05:37:51
国际油价16日显著下跌

国际油价16日显著下跌

新华社
2026-09-17 03:38:03
乌媒:俄罗斯新建五座大型厂房,用于组装使用中国零部件的无人机

乌媒:俄罗斯新建五座大型厂房,用于组装使用中国零部件的无人机

零度Military
2026-09-16 08:27:50
京沪高铁收支出炉:运行满 15 年,总投资约 2209 亿,回本了吗?

京沪高铁收支出炉:运行满 15 年,总投资约 2209 亿,回本了吗?

抽象派大师
2026-09-15 13:35:53
时代峰峻被约谈,旗下艺人集体封禁,饭圈疯魔无底线养成系要玩完

时代峰峻被约谈,旗下艺人集体封禁,饭圈疯魔无底线养成系要玩完

花哥扒娱乐
2026-09-14 21:10:26
太聪明了!平陆运河挖出来的渣土,直接出万亩良田

太聪明了!平陆运河挖出来的渣土,直接出万亩良田

小虎新车推荐员
2026-09-16 05:52:14
中方访美前夕,特朗普公开表态,台当局不敢相信是真的:听听就好

中方访美前夕,特朗普公开表态,台当局不敢相信是真的:听听就好

有范又有料
2026-09-15 21:30:25
会开到一半,印尼财长遭免职,中方接到通知,马六甲困局被打破

会开到一半,印尼财长遭免职,中方接到通知,马六甲困局被打破

二大爷观世界
2026-09-17 02:47:40
疯传!广州多校解散班级群?家长们吵破天…

疯传!广州多校解散班级群?家长们吵破天…

广州楼市发布
2026-09-16 21:24:08
一场安静的经济革命!钱和人开始往回流了,你还往大城市跑吗?

一场安静的经济革命!钱和人开始往回流了,你还往大城市跑吗?

李云飞Afey
2026-09-14 18:51:39
男童父亲反击6天后,“摸臀女”再迎噩耗,这次,她真踢到铁板了

男童父亲反击6天后,“摸臀女”再迎噩耗,这次,她真踢到铁板了

叨唠
2026-09-17 05:00:05
国乒男单全军覆没!18岁小将0-3不敌日本选手,8人参赛却无缘16强

国乒男单全军覆没!18岁小将0-3不敌日本选手,8人参赛却无缘16强

寒律
2026-09-17 01:19:28
重磅!CLTC续航1218公里!比亚迪全固态电池2027年正式上车

重磅!CLTC续航1218公里!比亚迪全固态电池2027年正式上车

沙雕小琳琳
2026-09-16 15:57:30
佩服武汉大学的公关能力!从通报到删除资料,武大仅用两周时间

佩服武汉大学的公关能力!从通报到删除资料,武大仅用两周时间

平老师666
2026-09-14 21:33:53
重返CBA?38岁琼斯官宣,正式签约,1年合同,曾效力新疆吉林

重返CBA?38岁琼斯官宣,正式签约,1年合同,曾效力新疆吉林

喜欢体育的猫
2026-09-16 10:38:02
央国企涌现一批的“新型干部”:满嘴战略,句句赋能,就是难落地

央国企涌现一批的“新型干部”:满嘴战略,句句赋能,就是难落地

可乐爱微笑
2026-09-16 13:41:06
华为养不起的大饭店,赛力斯第一天就重开了

华为养不起的大饭店,赛力斯第一天就重开了

大厂观察
2026-09-16 10:27:28
iPhone Duo可靠性翻车:影视飓风Tim在苹果总部掰一下就闪屏了

iPhone Duo可靠性翻车:影视飓风Tim在苹果总部掰一下就闪屏了

快科技
2026-09-17 00:37:10
2026-09-17 05:59:00
呼呼历史论
呼呼历史论
分享有趣的历史
975文章数 18130关注度
往期回顾 全部

科技要闻

赛力斯接管问界,撑得住华为给的身价吗?

头条要闻

3000万房产要拆迁 女子意外发现丈夫有16岁私生子

头条要闻

3000万房产要拆迁 女子意外发现丈夫有16岁私生子

体育要闻

对话西甲联盟高管:西班牙足球到底强在哪?

娱乐要闻

乔任梁去世十周年,陈乔恩悼念

财经要闻

邢自强:中美AI决胜点不在算力

汽车要闻

激光雷达+EVA机器人+爆胎稳行 星瑞L PLUS预售限时价11.57万起

态度原创

健康
房产
教育
游戏
军事航空

亲属查出脑动脉瘤?你也尽快筛查!

房产要闻

突发!三亚安居房出台新政!

教育要闻

官宣!南京又有两校公布办学成绩!

《暗黑4》新赛季正式上线 此前因服务器问题短暂延期

军事要闻

中东美军基地遭伊朗袭击后照片被披露

无障碍浏览 进入关怀版