一句话总结:当所有人还在用"参数越大越强"的旧逻辑训模型,Aether AI 给出了第三条路——让 Agent 在真实环境里自己探索、试错、沉淀经验,0 个权重更新就让 Kimi-K3 和 GLM-5.3 在 OSWorld 2.0 和 Agent's Last Exam 上反超 GPT-6 Astra 和 Claude Opus 5。为什么这篇值得写?
过去三年,AI 圈的所有发布会基本都遵循同一个公式——更大的参数、更长的训练、更贵的算力。Scaling Law 成了信仰:参数 ×10,能力就涨一波。
但 2026 年 9 月 14 日,arXiv 上挂出的论文《RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments》(2609.15364v1),把这套信仰翻了一面:
指标RSIAgent 之前的 GLM-5.3RSIAgent 之后的 GLM-5.3GPT-6 AstraClaude Opus 5OSWorld 2.0 (0808 offline)71.97%78.98%72.60%—Agent's Last Exam (Near-term)—84.82%82.26%—
关键差异:RSIAgent 没改一行模型参数。它只让 Agent 自己在真实软件里点来点去、把"踩过的坑"沉淀成可复用的 Memory,结果开源 Kimi-K3 / GLM-5.3 直接把闭源旗舰 GPT-6 Astra 推下了榜首。
这就是今天所有人都在讨论的第三条 Scaling 路径——Scale Experience(规模化经验),而不是 Scale Model。
先看图:3 句话读懂 RSIAgent
![]()
RSIAgent 把"训练-部署"两段式拆成一条持续进化的流水线:
- 1.三 Agent 闭环——Curriculum Agent 决定下一步探索什么,Actor Agent 真去操作,Verifier Agent 校验结果;
- 2.两阶段探索——先 Broad(并行广撒网)把环境结构画出来,再 Deep(顺序深挖)专挑硬骨头;
- 3.冻结记忆——所有经验沉淀进 Memory 后冻结,下游任务直接复用,模型参数一行不动
RSIAgent 是一套训练免费的多智能体递归自我改进框架,由 Aether AI 团队(Sibo Zhu、Shicheng Fan、Xinyue Wang 等)在 2026 年 9 月 14 日发布。论文 + 代码 + 网站三件套全开源:
- • 论文:https://arxiv.org/abs/2609.15364
- • 代码:https://github.com/AetherLabsAI/RSIAgent
- • 网站:https://aetherlabsai.github.io/RSIAgent/
它解决的是 Agent 落地最痛的问题——"模型再聪明,遇到没见过的软件也抓瞎"。
任何企业内网、私有 CRM、自研管理后台,对模型来说都是"陌生环境"。传统做法是换模型 → 换更大的模型 → 重新训。RSIAgent 换了个思路:模型不动,让 Agent 在目标环境里自己爬一遍。
核心机制:三个 Agent + 两阶段探索
![]()
RSIAgent 不是单 Agent,而是把工作切成三种角色:
角色职责类比Curriculum Agent决定下一步该探索什么方向新人 PM,每天给实习生派活Actor Agent真·点开软件、敲代码、抓 DOM手速担当的执行者Verifier Agent校验 Actor 的结果是否真发生毒舌 QA,对照截图/日志/状态码
三 Agent 围绕一个不断演化的 Memory闭环协作:生成任务 → 动手折腾 → 验证结果 → 沉淀经验 → 升级任务。
而探索分两阶段,像极了人类训练 AI 的两步——
第一阶段:Broad Recursive Self-exploration(广域探索)
类似 Pre-training:并行跑 10 个不同方向的任务——试工具、换输入、改权限、切浏览器——快速画出"这个系统大致长啥样"的拓扑图。
第二阶段:Deep Recursive Self-exploration(深度攻坚)
类似 Post-training:专门设计"边界压测题",专挑系统最脆弱的神经末梢下手。
消融实验证实:移除任一阶段,效果都会大打折扣。RSIAgent 真正在重新定义什么叫"扎实的基本功"。
数据说话:开源怎么反超闭源
![]()
基准GLM-5.3 基线GLM-5.3 + RSIAgentGPT-6 AstraClaude Opus 5提升幅度OSWorld 2.0 (0808)71.97%78.98%72.60%落后+7.01 ptsAgent's Last Exam (Near)—84.82%82.26%落后+2.56 pts
更夸张的是游戏开发场景(GameCraft-Bench):一些初始成功率只有 0–40% 的任务,经过多轮 RSI 探索后直接拉满到 100%。
而这一切——没有任何一次反向传播,没有任何一次梯度下降。
关键反常识:能力到底藏在哪里?
![]()
过去我们默认"能力藏在参数里"。RSIAgent 给出的答案是——能力藏在环境知识里。
一个没去过故宫的导游,背再多地理书也讲不出承乾宫的飞檐翘角;但一个去过 10 次的导游,一开口就是"你看这个斗拱是明代官式做法"。
Kimi-K3 和 GLM-5.3 是那个"没去过故宫"的导游;RSIAgent 给它们的是一份已经踩过坑的"故宫地图"。
代价是什么?几乎为零——没有额外训练成本,没有额外数据标注,模型权重一字不改。
三种场景,谁该立刻用 RSIAgent?场景 1:企业内部 Agent 落地
数据不能出内网、系统月月迭代、自研工具没有公开训练数据——RSIAgent 是天然解。让 Agent 在你自己的后台里爬一周,把"隐藏的输入校验、异步状态、失败重试路径"全沉淀进 Memory。
场景 2:模型选型受限于"开源生态"
买不起 GPT-6?无所谓。RSIAgent + Kimi-K3 / GLM-5.3 已经能跑赢它。省下的不只是 token 钱,还有合规和私有化部署的复杂度。
场景 3:研究 Agent Scaling 范式
"到底是 Scale Model 还是 Scale Experience?"——RSIAgent 给出的答案是两者可以叠加。下一步问题是:能不能用 RSI 找到新 Scaling 律?
三件需要冷静的事
- 1.Memory 会过期:论文没说"环境改了 Memory 怎么更新"。如果你的 UI 每周发版一次,Memory 到周四就过期了——必须配套自动检测 / 重新探索机制。
- 2.Verifier 也会被骗:如果 Verifier 自己没看清真实环境变化(DOM 误判、状态码漏检),错的经验也会写进 Memory。建议对 Memory 做外部交叉验证。
- 3.不是万能银弹:RSIAgent 解决的是"在新环境快速上手",不是"生成新能力"。模型本身的能力上限还在;但同一能力在不同环境下的落地效率,可以靠 RSI 大幅提升。
![]()
维度关键信号核心反常识训练免费、不更参数,开源模型反超闭源旗舰三 Agent 闭环Curriculum + Actor + Verifier 围绕演化 Memory两阶段策略Broad Recursive Self-exploration → Deep Recursive Self-exploration关键数字OSWorld 2.0: 71.97% → 78.98%(+7.01);Agent's Last Exam: 84.82%核心价值0 训练成本、0 数据标注、模型权重一字不改适用场景企业内 Agent / 私有化部署 / 模型选型注意事项Memory 过期检测 / Verifier 误判漏检 / 非万能银弹
重点回顾
- 1.RSIAgent 给出第三条 Scaling 路径:Scale Experience,而不是 Scale Model。开源 Kimi-K3 + GLM-5.3 用 RSI 在 OSWorld 2.0 从 71.97% 提到 78.98%,反超 GPT-6 Astra 的 72.60%。
- 2.三 Agent 闭环 + 两阶段策略:Curriculum / Actor / Verifier 持续迭代,Broad → Deep 一遍比一遍更深;Memory 冻结后下游任务直接复用。
- 3.0 训练成本、0 数据标注:所有经验都从真实环境里自己"踩坑"沉淀,对企业内 Agent 落地和私有化部署尤其友好。
- 4.核心反常识:能力不在参数里,在环境知识里。一个去过 10 次故宫的导游,比背 100 本书的导游讲得更生动。
- 5.Memory 会过期——这是 RSIAgent 当前最大盲区,下一步要解决自动检测 + 自动重新探索。
- • 论文:https://arxiv.org/abs/2609.15364
- • 代码:https://github.com/AetherLabsAI/RSIAgent
- • 网站:https://aetherlabsai.github.io/RSIAgent/
- • 中文解读:51CTO《在多项高难度 Benchmark 超越 GPT-6 Astra,RSIAgent 让开源模型自主探索新环境》
- • 团队主页:Aether AI 因果智能路线(Causal-Copilot / C-World / Auto-scaling Continuous Memory)
作者:科技爆款捕手 · 2026-09-16信源:arXiv 2609.15364v1 / 51CTO / AGI Hunt / 搜狐科技 / Aether AI 官方
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.