网易首页 > 网易号 > 正文 申请入驻

RSIAgent:开源 Kimi-K3 反超 GPT-6

0
分享至

一句话总结:当所有人还在用"参数越大越强"的旧逻辑训模型,Aether AI 给出了第三条路——让 Agent 在真实环境里自己探索、试错、沉淀经验,0 个权重更新就让 Kimi-K3 和 GLM-5.3 在 OSWorld 2.0 和 Agent's Last Exam 上反超 GPT-6 Astra 和 Claude Opus 5。
为什么这篇值得写?

过去三年,AI 圈的所有发布会基本都遵循同一个公式——更大的参数、更长的训练、更贵的算力。Scaling Law 成了信仰:参数 ×10,能力就涨一波。

但 2026 年 9 月 14 日,arXiv 上挂出的论文《RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments》(2609.15364v1),把这套信仰翻了一面:

指标RSIAgent 之前的 GLM-5.3RSIAgent 之后的 GLM-5.3GPT-6 AstraClaude Opus 5OSWorld 2.0 (0808 offline)71.97%78.98%72.60%—Agent's Last Exam (Near-term)84.82%82.26%—

关键差异:RSIAgent 没改一行模型参数。它只让 Agent 自己在真实软件里点来点去、把"踩过的坑"沉淀成可复用的 Memory,结果开源 Kimi-K3 / GLM-5.3 直接把闭源旗舰 GPT-6 Astra 推下了榜首。

这就是今天所有人都在讨论的第三条 Scaling 路径——Scale Experience(规模化经验),而不是 Scale Model。

先看图:3 句话读懂 RSIAgent



RSIAgent 把"训练-部署"两段式拆成一条持续进化的流水线:

  1. 1.三 Agent 闭环——Curriculum Agent 决定下一步探索什么,Actor Agent 真去操作,Verifier Agent 校验结果;
  2. 2.两阶段探索——先 Broad(并行广撒网)把环境结构画出来,再 Deep(顺序深挖)专挑硬骨头;
  3. 3.冻结记忆——所有经验沉淀进 Memory 后冻结,下游任务直接复用,模型参数一行不动
它到底是什么?

RSIAgent 是一套训练免费的多智能体递归自我改进框架,由 Aether AI 团队(Sibo Zhu、Shicheng Fan、Xinyue Wang 等)在 2026 年 9 月 14 日发布。论文 + 代码 + 网站三件套全开源:

  • • 论文:https://arxiv.org/abs/2609.15364
  • • 代码:https://github.com/AetherLabsAI/RSIAgent
  • • 网站:https://aetherlabsai.github.io/RSIAgent/

它解决的是 Agent 落地最痛的问题——"模型再聪明,遇到没见过的软件也抓瞎"

任何企业内网、私有 CRM、自研管理后台,对模型来说都是"陌生环境"。传统做法是换模型 → 换更大的模型 → 重新训。RSIAgent 换了个思路:模型不动,让 Agent 在目标环境里自己爬一遍

核心机制:三个 Agent + 两阶段探索



RSIAgent 不是单 Agent,而是把工作切成三种角色

角色职责类比Curriculum Agent决定下一步该探索什么方向新人 PM,每天给实习生派活Actor Agent真·点开软件、敲代码、抓 DOM手速担当的执行者Verifier Agent校验 Actor 的结果是否真发生毒舌 QA,对照截图/日志/状态码

三 Agent 围绕一个不断演化的 Memory闭环协作:生成任务 → 动手折腾 → 验证结果 → 沉淀经验 → 升级任务。

而探索分两阶段,像极了人类训练 AI 的两步——

第一阶段:Broad Recursive Self-exploration(广域探索)

类似 Pre-training:并行跑 10 个不同方向的任务——试工具、换输入、改权限、切浏览器——快速画出"这个系统大致长啥样"的拓扑图。

第二阶段:Deep Recursive Self-exploration(深度攻坚)

类似 Post-training:专门设计"边界压测题",专挑系统最脆弱的神经末梢下手。

消融实验证实:移除任一阶段,效果都会大打折扣。RSIAgent 真正在重新定义什么叫"扎实的基本功"。

数据说话:开源怎么反超闭源



基准GLM-5.3 基线GLM-5.3 + RSIAgentGPT-6 AstraClaude Opus 5提升幅度OSWorld 2.0 (0808)71.97%78.98%72.60%落后+7.01 ptsAgent's Last Exam (Near)84.82%82.26%落后+2.56 pts

更夸张的是游戏开发场景(GameCraft-Bench):一些初始成功率只有 0–40% 的任务,经过多轮 RSI 探索后直接拉满到 100%

而这一切——没有任何一次反向传播,没有任何一次梯度下降

关键反常识:能力到底藏在哪里?



过去我们默认"能力藏在参数里"。RSIAgent 给出的答案是——能力藏在环境知识里

一个没去过故宫的导游,背再多地理书也讲不出承乾宫的飞檐翘角;但一个去过 10 次的导游,一开口就是"你看这个斗拱是明代官式做法"。

Kimi-K3 和 GLM-5.3 是那个"没去过故宫"的导游;RSIAgent 给它们的是一份已经踩过坑的"故宫地图"

代价是什么?几乎为零——没有额外训练成本,没有额外数据标注,模型权重一字不改。

三种场景,谁该立刻用 RSIAgent?场景 1:企业内部 Agent 落地

数据不能出内网、系统月月迭代、自研工具没有公开训练数据——RSIAgent 是天然解。让 Agent 在你自己的后台里爬一周,把"隐藏的输入校验、异步状态、失败重试路径"全沉淀进 Memory。

场景 2:模型选型受限于"开源生态"

买不起 GPT-6?无所谓。RSIAgent + Kimi-K3 / GLM-5.3 已经能跑赢它。省下的不只是 token 钱,还有合规和私有化部署的复杂度

场景 3:研究 Agent Scaling 范式

"到底是 Scale Model 还是 Scale Experience?"——RSIAgent 给出的答案是两者可以叠加。下一步问题是:能不能用 RSI 找到新 Scaling 律?

三件需要冷静的事

  1. 1.Memory 会过期:论文没说"环境改了 Memory 怎么更新"。如果你的 UI 每周发版一次,Memory 到周四就过期了——必须配套自动检测 / 重新探索机制。
  2. 2.Verifier 也会被骗:如果 Verifier 自己没看清真实环境变化(DOM 误判、状态码漏检),错的经验也会写进 Memory。建议对 Memory 做外部交叉验证。
  3. 3.不是万能银弹:RSIAgent 解决的是"在新环境快速上手",不是"生成新能力"。模型本身的能力上限还在;但同一能力在不同环境下的落地效率,可以靠 RSI 大幅提升。
一张表带走所有信号



维度关键信号核心反常识训练免费、不更参数,开源模型反超闭源旗舰三 Agent 闭环Curriculum + Actor + Verifier 围绕演化 Memory两阶段策略Broad Recursive Self-exploration → Deep Recursive Self-exploration关键数字OSWorld 2.0: 71.97% → 78.98%(+7.01);Agent's Last Exam: 84.82%核心价值0 训练成本、0 数据标注、模型权重一字不改适用场景企业内 Agent / 私有化部署 / 模型选型注意事项Memory 过期检测 / Verifier 误判漏检 / 非万能银弹

重点回顾

  1. 1.RSIAgent 给出第三条 Scaling 路径:Scale Experience,而不是 Scale Model。开源 Kimi-K3 + GLM-5.3 用 RSI 在 OSWorld 2.0 从 71.97% 提到 78.98%,反超 GPT-6 Astra 的 72.60%。
  2. 2.三 Agent 闭环 + 两阶段策略:Curriculum / Actor / Verifier 持续迭代,Broad → Deep 一遍比一遍更深;Memory 冻结后下游任务直接复用。
  3. 3.0 训练成本、0 数据标注:所有经验都从真实环境里自己"踩坑"沉淀,对企业内 Agent 落地和私有化部署尤其友好。
  4. 4.核心反常识:能力不在参数里,在环境知识里。一个去过 10 次故宫的导游,比背 100 本书的导游讲得更生动。
  5. 5.Memory 会过期——这是 RSIAgent 当前最大盲区,下一步要解决自动检测 + 自动重新探索。
  • • 论文:https://arxiv.org/abs/2609.15364
  • • 代码:https://github.com/AetherLabsAI/RSIAgent
  • • 网站:https://aetherlabsai.github.io/RSIAgent/
  • • 中文解读:51CTO《在多项高难度 Benchmark 超越 GPT-6 Astra,RSIAgent 让开源模型自主探索新环境》
  • • 团队主页:Aether AI 因果智能路线(Causal-Copilot / C-World / Auto-scaling Continuous Memory)

作者:科技爆款捕手 · 2026-09-16信源:arXiv 2609.15364v1 / 51CTO / AGI Hunt / 搜狐科技 / Aether AI 官方

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
全军覆没!国青国少选拔赛乒二代登场:县城小将3-0横扫王楠女儿,王皓马琳儿子一轮游,无缘32强!网友调侃:连老爹的尾灯都看不到

全军覆没!国青国少选拔赛乒二代登场:县城小将3-0横扫王楠女儿,王皓马琳儿子一轮游,无缘32强!网友调侃:连老爹的尾灯都看不到

小七说篮球
2026-09-16 14:37:14
沙拉维:这场胜利对我们很重要,能帮助我们找回信心

沙拉维:这场胜利对我们很重要,能帮助我们找回信心

懂球帝
2026-09-16 06:47:16
赵一鸣早该查了,4块5的红牛,喝的不是提神,是套路!

赵一鸣早该查了,4块5的红牛,喝的不是提神,是套路!

椰青美食分享
2026-09-14 11:20:34
高市早苗改组内阁,中日关系又要变了?

高市早苗改组内阁,中日关系又要变了?

刘乐观天下
2026-09-15 18:09:06
"孙子非亲生案"律师:母亲拒绝做亲子鉴定成死局

"孙子非亲生案"律师:母亲拒绝做亲子鉴定成死局

看看新闻Knews
2026-09-17 00:46:03
严子怡教练清空社媒,网友换团队呼声让人心寒,好苗子她一手挖掘

严子怡教练清空社媒,网友换团队呼声让人心寒,好苗子她一手挖掘

杨华评论
2026-09-16 23:28:21
请马上停下这5种运动,否则心脏可能先报废,很多老人还在坚持

请马上停下这5种运动,否则心脏可能先报废,很多老人还在坚持

王二哥老搞笑
2026-09-16 15:16:04
日本亚运会将开幕,高市却要中国5倍签证费,名古屋这场或要大亏

日本亚运会将开幕,高市却要中国5倍签证费,名古屋这场或要大亏

旧史新谭
2026-09-05 14:10:11
得知JJ加布里埃尔转会传闻,加纳乔转发视频并配文:希望不会落得和我一样的下场

得知JJ加布里埃尔转会传闻,加纳乔转发视频并配文:希望不会落得和我一样的下场

MUREDS
2026-09-17 00:48:28
发现一个残酷事实:封杀5年的赵薇,经济状况被扒,如今再难翻身

发现一个残酷事实:封杀5年的赵薇,经济状况被扒,如今再难翻身

动物奇奇怪怪
2026-09-17 04:39:19
前ESPN主持人琳达·科恩:美国女篮世界杯夺冠,但世界其他球队正在逼近

前ESPN主持人琳达·科恩:美国女篮世界杯夺冠,但世界其他球队正在逼近

坠入温柔晚风
2026-09-16 23:06:35
斗胆说几句山东这起“243万茅台盗窃案”

斗胆说几句山东这起“243万茅台盗窃案”

林中木白
2026-09-16 22:44:02
中国各地为啥一夜之间多出这么多零食店,评论区一针见血!

中国各地为啥一夜之间多出这么多零食店,评论区一针见血!

另子维爱读史
2026-09-10 10:54:11
内讧矛盾?杨舒予被免,新队长任命,00后,首次大赛,宫鲁鸣不该犯错

内讧矛盾?杨舒予被免,新队长任命,00后,首次大赛,宫鲁鸣不该犯错

户外露营装备库
2026-09-04 10:59:37
胡塞武装扩大了攻击和控制范围,埃及拒绝就曼德海峡与其谈判

胡塞武装扩大了攻击和控制范围,埃及拒绝就曼德海峡与其谈判

一种观点
2026-09-14 19:57:26
北青:张玉宁的父亲在美国看了亚运直播,二人整整一周没通话

北青:张玉宁的父亲在美国看了亚运直播,二人整整一周没通话

懂球帝
2026-09-16 20:45:09
香山论坛一开幕,董军让100多国提高警惕,日方来了也是自取其辱

香山论坛一开幕,董军让100多国提高警惕,日方来了也是自取其辱

湘评中外
2026-09-16 17:09:47
暴走团老人路上训练,交警劝不听,货车司机“不想走那就别走了”

暴走团老人路上训练,交警劝不听,货车司机“不想走那就别走了”

源远讲堂
2025-07-31 18:13:50
别再乱猜养老金!人社部亮出家底,都是实在话

别再乱猜养老金!人社部亮出家底,都是实在话

白昼说故事
2026-09-15 10:18:32
江西省农业厅副厅长曹爱珍:仅5年从教师晋升副县长,耀眼明星终落马

江西省农业厅副厅长曹爱珍:仅5年从教师晋升副县长,耀眼明星终落马

十为先生
2026-09-11 14:18:51
2026-09-17 05:27:00
呼呼历史论
呼呼历史论
分享有趣的历史
975文章数 18130关注度
往期回顾 全部

科技要闻

赛力斯接管问界,撑得住华为给的身价吗?

头条要闻

3000万房产要拆迁 女子意外发现丈夫有16岁私生子

头条要闻

3000万房产要拆迁 女子意外发现丈夫有16岁私生子

体育要闻

对话西甲联盟高管:西班牙足球到底强在哪?

娱乐要闻

乔任梁去世十周年,陈乔恩悼念

财经要闻

邢自强:中美AI决胜点不在算力

汽车要闻

激光雷达+EVA机器人+爆胎稳行 星瑞L PLUS预售限时价11.57万起

态度原创

本地
家居
时尚
艺术
游戏

本地新闻

不止胖东来!许昌藏着半部三国史

家居要闻

2026建博会(广州) 公装联探展交流活动

8年没换过|| 每次“垮脸”都靠它救,这笔小投资已值回本

艺术要闻

这才是国画!刘佰玥“西遇”山水,治好了我的精神内耗!

《暗黑4》新赛季正式上线 此前因服务器问题短暂延期

无障碍浏览 进入关怀版