网易首页 > 网易号 > 正文 申请入驻

学术分享丨LSTM之父最新97页综述:Agent如何真正学会「自我进化」?

0
分享至

转自 新智元

过去两年,self-reflection、self-correction、self-play、agentic RL、skill learning、test-time adaptation、open-ended evolution、self-evolving agent等概念不断涌现。

它们有时指模型继续训练,有时指Prompt或工具自动优化,也有时被直接归入递归式自我改进(Recursive Self-Improvement,RSI)。

问题在于,这些术语描述的变化层级和强度并不相同,却长期缺少一套统一坐标系。

近日,来自吉林大学、KAUST、阿尔伯塔大学和瑞士人工智能实验室等机构的研究团队发布综述,从系统层面重新定义「自我改进」,并将模型训练、记忆演化、工具创建和Agent架构搜索放进同一张地图。配套项目目前已整理312篇相关工作。


论文链接: https://arxiv.org/abs/2607.13104

项目主页: https://selfimproving-agent.github.io/

代码链接: https://github.com/selfimproving-agent/awesome-Self-Improving-Agents

值得一提的是,这篇综述发布后迅速在海外AI社区获得关注。配套GitHub仓库一周左右已收获200+Stars,;X上也有不少论文推荐帖也获得了约800个Likes。这也折射出一个清晰信号,self-improving agent正成为海外研究者和开发者共同关注的新焦点。


图 1:配套 GitHub 仓库在一周左右获得200+Stars。


图2:X上的论文推荐帖获得约800个Likes。


图3:现代自我改进Agent的整体版图。

什么才算「自我改进」

论文将基础模型Agent表示为:

其中,θ是基础模型参数;Σ是围绕模型运行的脚手架,包括Prompt、Memory、Tools,以及路由、调度和安全约束等控制逻辑。

这个定义划出了一条重要边界:上下文中的临时计划、对话历史和一次性反思,只属于运行时状态;只有当系统依据自身执行产生的轨迹、评价或验证结果,持久修改了θ或Σ,并让下一次任务从不同起点出发,才构成真正的self-improvement。

因此,self-reflection和self-correction本身不必然等于自我改进。一次任务中「再想一遍」可以提高当前答案,却未必留下任何跨任务能力。反过来,一条经过验证并写入长期记忆的规则、一个被修复后持续复用的工具,哪怕没有更新模型权重,也已经改变了Agent未来的行为。

自我改进也不是大模型时代突然出现的概念。从反馈控制、学习如何学习、自指程序,到Gödel Machine和元学习,相关思想延续了数十年。基础模型带来的变化,在于自然语言成为统一的修改介质:错误可以写成批评,经验可以压缩为记忆,工具和工作流可以直接生成与重写。自我修改由此从低层代码与权重搜索,逐渐变成更可表达、也更可检查的工程过程。


图4:基础模型提供认知能力,Prompt、Memory、Tools与控制逻辑共同决定Agent如何感知、推理和行动。

两条路线

写进模型,或写进系统

第一条路线是Foundation Model Improvement。Agent自己生成训练示例、评价信号,或从真实环境与世界模型中获得探索经验,再通过SFT、偏好优化或强化学习写回参数。这类更新较慢、成本较高,也不易回滚,但一旦成功,能力可以跨任务共享。

论文将其学习信号分为三类:一是自生成示例与推理轨迹,二是模型给出的分数、偏好或批评,三是来自代码执行、网页交互、游戏和机器人环境的真实或模拟经验。Self-Instruct、Constitutional AI、WebRL等分别体现了这些思路。

风险也很直接:模型可能把自身错误重新训练进权重,导致偏差放大、模型坍塌或灾难性遗忘;也可能学会钻奖励函数和世界模型的空子。参数更新因此必须配合数据过滤、外部验证、版本管理和回滚。

第二条路线是Scaffolding Improvement。模型参数保持不变,系统改写Prompt,整理和淘汰Memory,选择、修复或创建Tools,甚至重构规划器、路由器和整套Agent代码。TextGrad、Mem0、Voyager、Gödel Agent、Darwin Gödel Machine等工作都可放入这条路线。它更轻量、更透明,也更容易验证和撤销,因此是当前工程实践中最活跃的方向。

论文对skill的处理尤其值得注意:skill不是Prompt、Memory、Tool之外的第五个组件,而是一种「可序列化、可复用的更新」。同一个技能可以被存成工具及其调用约定,可以是一条工作流或记忆,也可以被固化进权重或控制逻辑。换言之,skill描述的是「保留下来的能力单元」,而不是它被存在哪里。

这种定义也区分了两类技能:对象级skill用于完成外部任务,例如反复调用一段「收集资源」流程;元级skill则直接作用于Agent自身,例如重写Prompt、整理Memory、创建工具或触发参数更新。后者一旦还能改进「如何改进自己」,就开始触及RSI最核心的自指结构。

但这里需要降温:今天多数所谓RSI,仍是受目标函数、测试集、沙箱和权限边界约束的「有限自我修改」,距离不受约束的智能爆炸相去甚远。论文关注的重点也不是科幻式失控,而是如何让这种更新可测量、可归因、可回滚。

两条路线并非彼此排斥。更合理的系统会让脚手架承担快速、局部、可逆的探索,再把反复验证有效的经验蒸馏进参数,形成「快速适应—慢速固化」的双时间尺度。


图5:基础模型更新与脚手架更新构成两条主路径。

六大应用场景

论文系统梳理了六类应用:软件工程、网页导航与自动化、游戏与策略推理、科学发现、具身智能与机器人、通用计算机控制。它们的共同点是Agent都能从环境获得反馈;差异在于反馈是否可靠、获取成本多高,以及失败能否撤销。

软件工程拥有编译器、单元测试和持续集成,是反馈最密集、结果最容易验证的试验场。网页Agent面对的则是持续变化的页面、DOM和API,需要把成功与失败轨迹沉淀为记忆、grounding策略或可复用工具。游戏能够提供可重置环境、清晰规则和self-play经验,但也可能让Agent过拟合固定对手或钻模拟器的空子。

科学发现把循环扩展到假设、实验与证据管理,难点在于新颖性、可复现性和反馈延迟。具身智能需要跨越仿真与现实,处理sim-to-real gap和物理安全。通用计算机控制则要跨应用与操作系统形成可迁移的程序性经验。

在这些场景中,skill可以是代码修复流程、网页策略、游戏技能库、实验工作流、机器人动作程序或桌面操作脚本。介质不同,核心都是把一次成功转化为可复用的持久更新。


图6:自我改进Agent的六类代表性应用,以及各领域常用的环境与反馈来源。

如何评测一个会持续变化的系统

传统基准只测静态模型的最终分数,但自我改进Agent的研究对象是一条更新轨迹。可信实验至少要回答:固定预算下每轮提高多少?能否迁移到未见任务?旧问题是否再次失败?消耗了多少工具调用与人工监督?安全风险是否累积?

论文区分了可执行指标与Judge-based评测:前者适合代码和工具调用,后者覆盖开放式、长链条任务。如果同一个模型既提出改进又负责打分,Agent可能只是越来越会讨好「裁判」。因此,生成者与评估者应分离,并用独立Judge、隐藏测试和可验证子集校准。

评测还要覆盖两个层面:机制级评测隔离Prompt、Memory、Tool或参数更新的贡献;领域级评测检验其能否承受分布变化、执行成本和安全约束。不只看Agent达到多高,还要看它以多大代价、沿怎样的轨迹到达。


图7:自我改进Agent常用benchmark的分布,覆盖模型层与脚手架层、静态任务与交互式任务。

从快速探索到慢速固化

论文给出的核心设计原则,可以概括为八个字:快环探索,慢环固化。

在反馈嘈杂、任务变化快时,优先修改Prompt、Memory、Tools和控制逻辑,因为这些变化透明、便宜、可回滚。只有当一种策略经过充分验证,证明能够跨任务迁移时,再把它蒸馏或微调进模型权重,成为稳定的长期能力。真正成熟的系统不会在「改模型」与「改脚手架」之间二选一,而会让两条路径形成协同循环。

论文据此提出六个方向:测试时持续适应、主动探索与好奇心、参数蒸馏与模型—脚手架联合优化、资源受限的改进效率、多Agent协作式共同进化,以及面对环境变化的开放世界鲁棒性。

进化越深入

安全边界越重要

当Agent能够修改Memory、Tools乃至自身代码时,安全对象本身也在变化。一次Prompt Injection可能不再只是临时干扰,而会被写入记忆或工具逻辑,成为持久漏洞。因此,Critic应被视为受治理的基础设施,提出更新与批准更新也不应由同一闭环完全控制。每次修改都要经过功能、权限和安全检查。尤其在Full Scaffolding与RSI场景中,Agent应被当作受保护环境中的「不可信程序」,所有更新都需经过分层门控。

未来的AI进步,未必只来自更多参数。更值得关注的是:Agent能否从失败中提取经验,把经验封装为可复用skill,管理自己的记忆与工具,修改工作流程,再把验证过的能力稳妥沉淀下来。当AI从「每次任务都重新开始」,走向「每次任务都留下可验证的成长」,它才真正跨过从工具到学习型系统的门槛。所谓self-evolving agent的关键,也不在「进化」这个热词本身,而在每一次更新是否持久、有效,并且始终处于可控边界之内。

结语

这篇综述真正提供的,不是又一个关于「AI自我进化」的宏大预言,而是一套判断进步是否真实发生的工程语言:经验有没有被保存,能力能不能被复用,收益能否跨任务迁移,更新是否经得起验证。

未来的Agent或许会越来越擅长修改自己,但比「会进化」更重要的,是它知道该改什么、为什么改,以及什么时候不应该改。

参考资料:

https://arxiv.org/abs/2607.13104

编辑:LRST

【免责声明】转载出于非商业性的教育和科研目的,只为学术新闻信息的传播,版权归原作者所有,如有侵权请立即与我们联系,我们将及时删除。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
居莱尔在穆帅执教下,完成蜕变之后,皇马决定为居莱尔涨薪,签新合同!

居莱尔在穆帅执教下,完成蜕变之后,皇马决定为居莱尔涨薪,签新合同!

福酱的小时光
2026-09-10 23:07:51
就煮三回,肺部老痰就通开了!白痰黄痰一抹而空,嗓子好舒服!

就煮三回,肺部老痰就通开了!白痰黄痰一抹而空,嗓子好舒服!

小谈食刻美食
2026-09-08 08:59:43
 李大钊的藏身地固若金汤,把他供出来的不是敌人,而是他最信任的人

 李大钊的藏身地固若金汤,把他供出来的不是敌人,而是他最信任的人

磊子讲史
2026-09-10 17:11:14
许家印大概怎么也没料到,自己刚被判刑才四天,王健林就凭一系列举措让口碑迅速逆势翻红

许家印大概怎么也没料到,自己刚被判刑才四天,王健林就凭一系列举措让口碑迅速逆势翻红

人生录
2026-08-30 00:05:13
微信付款立新规?9月30日生效,零钱通里的钱,要不要提前转出来

微信付款立新规?9月30日生效,零钱通里的钱,要不要提前转出来

青梅侃史啊
2026-09-09 14:22:51
挪威国王葬礼,十位王后齐聚!新王后没存在感,夏琳穿裤装引争议,莱后抢镜…

挪威国王葬礼,十位王后齐聚!新王后没存在感,夏琳穿裤装引争议,莱后抢镜…

商务范
2026-09-10 15:02:40
央行、证监会、国家外汇局,最新发声

央行、证监会、国家外汇局,最新发声

证券时报
2026-09-10 16:28:19
手机双卡别乱插!卡槽1和卡槽2不是随便放,很多人一直用错

手机双卡别乱插!卡槽1和卡槽2不是随便放,很多人一直用错

小柱解说游戏
2026-09-05 10:04:53
谢婷婷罕见发声,揭开前嫂子张柏芝真面目,与网络传言天差地别

谢婷婷罕见发声,揭开前嫂子张柏芝真面目,与网络传言天差地别

看尽落尘花q
2026-08-04 15:28:11
苹果上架带支架保护壳iPhone Duo双面夹 售价999元

苹果上架带支架保护壳iPhone Duo双面夹 售价999元

CNMO科技
2026-09-10 11:39:30
25号台风杜鹃或将登场,26号台风舒力基随后?暴雨大暴雨12日到,冷空气活跃,南方气温暴跌15度

25号台风杜鹃或将登场,26号台风舒力基随后?暴雨大暴雨12日到,冷空气活跃,南方气温暴跌15度

老牛讲
2026-09-10 17:18:49
“乱港分子”周庭:弃保潜逃加拿大,扬言“永不回国”,如今怎样

“乱港分子”周庭:弃保潜逃加拿大,扬言“永不回国”,如今怎样

芊芊子吟
2026-03-05 19:45:03
iPhone 18 Pro来了,9月12日晚8点天猫新品开卖

iPhone 18 Pro来了,9月12日晚8点天猫新品开卖

深潜atom
2026-09-10 17:32:59
快船又爆丑闻!脚踝骨折说扭伤,骗诊毁球员生涯:28岁就离开联盟

快船又爆丑闻!脚踝骨折说扭伤,骗诊毁球员生涯:28岁就离开联盟

你的篮球频道
2026-09-10 09:53:34
停止资助威胁资助人女孩愿意把苹果17promax换红米,资助人送去1500元,这是什么神仙逻辑

停止资助威胁资助人女孩愿意把苹果17promax换红米,资助人送去1500元,这是什么神仙逻辑

Mr王的饭后茶
2026-09-10 09:35:52
贾斯汀·比伯大方晒两岁爱子,生日早餐插粉色蜡烛,海莉高调表白一家三口

贾斯汀·比伯大方晒两岁爱子,生日早餐插粉色蜡烛,海莉高调表白一家三口

世界王室那些事
2026-09-08 21:05:03
女篮世界杯8强对阵出炉!中国女篮进入天堂半区,晋级四强有戏了

女篮世界杯8强对阵出炉!中国女篮进入天堂半区,晋级四强有戏了

侃球熊弟
2026-09-10 01:34:38
美联储下周加息“箭已上弦”?前纽约联储首席:就看8月CPI改善多少!

美联储下周加息“箭已上弦”?前纽约联储首席:就看8月CPI改善多少!

科创板日报
2026-09-10 15:32:03
格局拉满!被刘亦菲裁掉合照后,越南女星温柔回应:我会更加努力

格局拉满!被刘亦菲裁掉合照后,越南女星温柔回应:我会更加努力

观鱼听雨
2026-09-09 23:58:17
虚云老和尚98岁重回故乡寻母,他见到转世的母亲究竟说了什么呢?

虚云老和尚98岁重回故乡寻母,他见到转世的母亲究竟说了什么呢?

阿珂读书
2025-01-10 13:37:56
2026-09-11 00:27:00
中国人工智能学会
中国人工智能学会
中国人工智能学会网易官方账号
4281文章数 1492关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

"弟弟举报哥哥冒名顶替上大学案"进展:哥哥举报湘大

头条要闻

"弟弟举报哥哥冒名顶替上大学案"进展:哥哥举报湘大

体育要闻

16岁的国产小库里,还有多少功课要做

娱乐要闻

参加晚宴,刘亦菲因合照深陷争议

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

标配全线控底盘 全新一代智己LS6预售20.99万起

态度原创

旅游
艺术
亲子
时尚
家居

旅游要闻

鲁豫双向奔赴!河南文旅推广周走进运河之都济宁

艺术要闻

中国第二高楼的4个竞赛方案,建筑界“神仙打架”!

亲子要闻

诺和诺德帕西生长激素注射液三项儿童新适应证在华获批

腿粗女孩的王炸显瘦技巧,它来了

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版