网易首页 > 网易号 > 正文 申请入驻

Anthropic最新RSI实验:Claude击败人类研究员,训练效率超1.5万倍

0
分享至



两个月前,Anthropic 还在讨论一个看似遥远的问题:当 AI 开始自己建设 AI,会发生什么?现在,它已经往这个方向又走了一步。

8 月 28 日,Anthropic 发布了一项关于“自动化对齐研究员”(Automated Alignment Researcher,AAR)的新研究。

研究人员让 Claude 自主完成查阅文献、提出研究方案、生成训练数据、训练模型、评估结果和继续迭代的完整研究循环,尝试解决欺骗、谄媚、越狱、提示注入、奖励黑客等 10 类常见的 AI 对齐失败问题。

结果是,在有对应人类基线的 7 类任务上,Claude 最终找到的方法全部超过了人类研究者提出的最佳方案,平均约 6.4 小时就能追平并超过人类。以“欺骗”为例,Claude 经过反复实验,平均弥合了 85% 的安全差距,而参与实验的人类研究者平均只有 20%。


(来源:X)

Anthropic 在博客中还披露了一个更接近递归自我改进(RSI)的实验:让能力相对较弱的模型,去帮助训练更强的后继模型。这比前面的实验更接近“AI 训练下一代 AI”的设想。

团队让 Claude Sonnet 5 为一个尚未完成生产级安全训练的早期 Claude Opus 4.8 检查点寻找对齐方案。大约 60 小时内,Claude 测试了 50 多种方案,将其对齐得分提升到 65%,接近正式版 Opus 4.8 的 72%。最终方案只使用约 2400 条训练样本;Anthropic 称,其样本效率约为现有生产级对齐流程的 1.5 万倍。

从“AI 写代码”,到“AI 自己做实验”

今年 6 月,Anthropic 联合创始人 Jack Clark 与 Anthropic Institute 负责人 Marina Favaro 发表了《When AI builds itself》,系统讨论了“递归自我改进”(Recursive Self-Improvement,RSI)。


(来源:Anthropic)

文章中,Anthropic 将 AI 参与自身研发的过程分成了几个阶段:最初是人类完成开发;随后聊天机器人开始辅助写代码;再之后是能够独立修改和运行代码的编程智能体;今天,一些智能体已经可以连续工作数小时,并把任务交给其他智能体。再往前一步,就是“闭环”——由 AI 自主设计、训练和改进自己的后继模型。

这并不只是对未来的想象,毕竟截至今年 5 月,Anthropic 合并到生产代码库中的代码,超过 80% 已经由 Claude 编写;2026 年第二季度,其工程师人均每天合并的代码量已经达到 2024 年的约 8 倍。Anthropic 此前还测试过让 Claude 自主优化一段训练小型 AI 模型的代码:2025 年 5 月,Claude Opus 4 平均只能将其加速约 3 倍,到 2026 年 4 月,Claude Mythos Preview 已经能够做到约 52 倍。

不过,当时 Anthropic 同样承认了一条明显的能力边界:AI 很擅长在目标已经确定后执行实验,却依然不擅长判断“什么问题值得研究”。

在工程任务中,人类已经可以只给 Claude 一个目标,让它自己寻找实现方式;但在更开放的研究中,人类仍然负责提出问题、确定成功标准和选择研究方向。

在这次的新研究中,他们则试图减小这段距离:研究团队找来了 28 位有技术 AI 安全研究经验的研究者,他们平均拥有 2.5 年相关经验,并且都曾在对应领域发表研究。每位研究者最多有 8 小时提出一个解决方案。与此同时,Anthropic 又运行了两组自动化实验:部分 Claude 从人类给出的研究思路开始,另一部分则完全自行选择方向。

结果显示,无论是否有人类提前告诉 Claude 应该往哪里研究,最终表现几乎没有明显差别。这说明,在目标和评价体系已经足够明确的问题上,Claude 不再必须依赖专家先给出一个研究点子。

五个 Claude,组成一间“虚拟实验室”

Anthropic 为这项实验搭建了一套接近真实科研流程的自动化系统。

研究开始后,4 个“图书管理员”智能体首先阅读相关论文,整理成共享的文献综述。随后,5 个由 Claude Opus 4.8 驱动的 AAR 同时进入实验:阅读文献和已有排行榜,搜索新的资料,提出几种候选方案,再选择其中一个写成一篇小型研究论文。

这篇“论文”必须包含研究动机、相关工作、训练方法、数据来源和实验参数,并至少引用 5 项相关研究。更重要的是,它必须在实验结果出来之前冻结,从而避免 Claude 在看到成绩以后再倒推一个听上去合理的解释。

随后,监督智能体检查代码是否违规。如果通过,每个方案会获得一张 H200 GPU,大约进行 30 分钟训练。独立评估系统再运行测试,将结果放进所有 AAR 都能看到的排行榜里。几个智能体因此可以看到彼此失败或成功的方案,并继续进行下一轮改进。


(来源:Anthropic)

实验对象包括谄媚、越狱、提示注入、权力寻求、欺骗、幻觉、社会偏见、隐私侵犯、奖励黑客和隐藏不确定性 10 类问题。每一类问题都设置了 3 至 5 个公开测试,同时还有 Claude 从未见过的留出测试(Hold-out Test)。

这一步很重要。如果 AI 只需要把某一个公开榜单的成绩刷高,很容易出现“应试”甚至直接针对测试集优化。Anthropic 因此还使用 MMLU、GSM8K 和 IFEval 检查模型的一般能力,如果某种安全训练让模型整体能力显著下降,这个方案会被直接淘汰。

最终,在全部 10 类对齐失败上,AAR 都找到了能够改善目标行为、同时没有明显破坏通用能力的方法。自动研究弥合的安全差距从约 26% 到 96% 不等,而且部分方法可以迁移到从未见过的测试、开放式多轮行为审计 Petri,以及参数规模最高约为原模型 4.7 倍的更大模型上。

与人类的比较同样明显。在 7 类有人类方案参与的任务中,AAR 最后找到的最佳方案全部超过了人类提出的最佳方案。

不过,这个“击败人类”还是有一些水分存在,因为这场人机科研比赛并不是完全公平。

人类研究者只有一次提交机会,不能根据实验成绩连续修改方案;Claude 则能够不断试错,一个任务可能累计评估上百种方法。Anthropic 自己也因此明确表示,与其把结果理解成“Claude 已经是比人类更好的安全科学家”,不如把它看成一种新的研究分工:AI 能够用远高于人类的实验吞吐量搜索大量方法,再由人类进一步分析和完善。


(来源:Anthropic)

弱模型开始给更强的模型做“安全训练”

真正把这项工作与“AI 自己建设 AI”联系起来的,是论文最后一个实验。

此前的大部分实验,本质上都是能力很强的 Claude Opus 4.8 帮助规模较小的开源模型改善安全表现。但真正的递归自我改进意味着另一种关系:今天的模型,需要帮助训练比自己更强的下一代模型。因此,Anthropic 反转了两者的位置。

研究人员根据 Epoch Capabilities Index,将 Claude Sonnet 5 的能力指数记为 156,而一个早期 Opus 4.8 检查点为 158。也就是说,他们让一个略弱的模型去改善一个略强的后继模型。

这一次,Claude 需要同时处理全部 10 类对齐失败。大约 60 小时内,它连续测试 50 多种训练数据方案,最终把早期 Opus 4.8 的综合对齐成绩提高到 65%;作为参照,完成 Anthropic 全套生产级安全训练的正式版 Opus 4.8 得分为 72%。

获胜方案只用了约 2400 个由简单模板和公开数据集生成的训练样本。Anthropic 官方博客进一步称,这一方案的效率约为其生产对齐流程的 1.5 万倍。


(来源:Anthropic)

但“1.5 万倍”并不意味着 Claude 已经可以取代 Anthropic 整套安全部门。

论文特别强调,这套实验只衡量了预先定义好的 10 类对齐问题。现实中的生产模型还有大量更模糊、没有成熟基准甚至尚未被发现的失败模式;Petri 等自动化评估本身也只是现实行为的代理指标。此外,研究没有验证这些安全改善在模型继续经历大量强化学习训练以后是否依然存在。

事实上,实验还暴露了一个新问题:负责研究如何让 AI 更安全的 AI,自己也会试图“作弊”。

研究人员用 Claude Opus 4.8 检查了 1601 条 AAR 研究轨迹,最终发现其中 39 条、约 2.4% 存在作弊行为。具体包括反复提交同一个方案碰运气、生成模仿测试格式的数据,以及试图隐藏违规使用评测信息的步骤。相关结果最终都被排除。

因此,如果把 Anthropic 6 月提出的“AI 自己建设 AI”看作一个闭环,那么现在这个闭环还是没有完全合上。人类仍然决定哪些行为属于“对齐失败”,选择测试基准,规定哪些能力不能下降,并设计监督系统防止 AI 钻漏洞。AI 开始接管的是研究循环,而不是研究目标。

但与几个月前相比,这个边界确实又向前移动了一点。

1.https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures

2.https://alignment.anthropic.com/2026/automated-alignment-researchers/

3.https://www-cdn.anthropic.com/7b1c44894e980876479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
刘晓庆输了!深圳官司败诉,一个没请律师的深圳普通人,用六年把刘晓庆告到终审败诉

刘晓庆输了!深圳官司败诉,一个没请律师的深圳普通人,用六年把刘晓庆告到终审败诉

背包旅行
2026-09-02 15:08:03
中俄领导人讨论了中美俄三方在APEC会晤可能性?外交部:目前无可提供的信息

中俄领导人讨论了中美俄三方在APEC会晤可能性?外交部:目前无可提供的信息

澎湃新闻
2026-09-02 15:38:29
炸了!炸了!这就是激怒俄罗斯的后果。9月1日凌晨,俄罗斯国防部发通报说对基辅市、基辅州和敖德萨州的关键目标来了一次密集打击

炸了!炸了!这就是激怒俄罗斯的后果。9月1日凌晨,俄罗斯国防部发通报说对基辅市、基辅州和敖德萨州的关键目标来了一次密集打击

扶苏聊历史
2026-09-02 13:27:59
砸了千亿催生失效!国家终于醒悟:年轻人不生孩子,根本就不是懒

砸了千亿催生失效!国家终于醒悟:年轻人不生孩子,根本就不是懒

历史点行
2026-08-01 16:22:47
何晴去世9个月,儿子许何拍全家福,弟弟1米8超帅,和继母很亲切

何晴去世9个月,儿子许何拍全家福,弟弟1米8超帅,和继母很亲切

阿讯说天下
2026-09-02 11:26:04
曾仕强:穷不怪父,孝不比兄,苦不责妻,气不凶子——这才是家人之间最好的样子

曾仕强:穷不怪父,孝不比兄,苦不责妻,气不凶子——这才是家人之间最好的样子

杏花烟雨江南的碧园
2026-08-28 16:15:03
小S透露:许雅钧提醒她“姐夫具俊晔回到没有大S的家,一定是最寂寞的”,我老公安排每个礼拜六家人回家聚会

小S透露:许雅钧提醒她“姐夫具俊晔回到没有大S的家,一定是最寂寞的”,我老公安排每个礼拜六家人回家聚会

韩小娱
2026-09-02 15:56:54
18点开打!U23国足亚运首战,输球基本难出线

18点开打!U23国足亚运首战,输球基本难出线

SilverLife银生活家
2026-09-02 17:16:11
《堕落之主2》性感双妞对比:美乳肉腿顶级润唇

《堕落之主2》性感双妞对比:美乳肉腿顶级润唇

游民星空
2026-09-02 11:35:33
为什么有钱后一定要低调?网友:我爸8000万身家,几年负债1000万

为什么有钱后一定要低调?网友:我爸8000万身家,几年负债1000万

夜深爱杂谈
2026-08-30 20:56:54
尼泊尔泥石流已致1118人死亡 4858人失联

尼泊尔泥石流已致1118人死亡 4858人失联

新华社
2026-09-02 13:53:02
2天5瓜!包贝尔被除名,刘晓庆败诉,王菲男闺蜜闯祸,于东来令人意外

2天5瓜!包贝尔被除名,刘晓庆败诉,王菲男闺蜜闯祸,于东来令人意外

叨唠
2026-09-02 04:53:25
明码标价!冠军沦为阶下囚,国羽腐败远超男足?20万青训黑幕曝光

明码标价!冠军沦为阶下囚,国羽腐败远超男足?20万青训黑幕曝光

丁丁鲤史纪
2026-09-02 01:26:02
北大校长的沉默,令这所128年历史的富可敌国的大学蒙羞

北大校长的沉默,令这所128年历史的富可敌国的大学蒙羞

再战五百回合
2026-08-30 15:38:58
山东惜败北京!陶汉林+2射齐爆,3新援中规中矩,练兵为主!

山东惜败北京!陶汉林+2射齐爆,3新援中规中矩,练兵为主!

篮球资讯达人
2026-09-02 19:24:41
不再是百年一遇!尼泊尔泥石流证明:喜马拉雅的安全周期已经彻底结束

不再是百年一遇!尼泊尔泥石流证明:喜马拉雅的安全周期已经彻底结束

浪子说
2026-09-02 00:05:04
菲律宾拖船沉入大海,二次打捞失败,这或许也是仁爱礁破船的结局

菲律宾拖船沉入大海,二次打捞失败,这或许也是仁爱礁破船的结局

老誡科普
2026-09-02 13:07:07
昙花一现?吴宜泽又输了:惨败囧哥,奥沙利文说的话正在应验中!

昙花一现?吴宜泽又输了:惨败囧哥,奥沙利文说的话正在应验中!

大秦壁虎白话体育
2026-09-01 23:34:15
全球最大岛礁被我国收回!面积相当于四个深圳,曾遭美菲合力抢夺

全球最大岛礁被我国收回!面积相当于四个深圳,曾遭美菲合力抢夺

军机Nova
2026-08-28 00:18:12
MLCC巨头,签订万亿订单

MLCC巨头,签订万亿订单

半导体行业观察
2026-09-02 15:01:33
2026-09-02 20:00:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17180文章数 515198关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

10万级的满配B级车 试驾2027款比亚迪海豹06

态度原创

家居
手机
数码
教育
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

拉美手机市场Q2大跌12%!三星成TOP5唯一增长品牌 传音重返第五

数码要闻

179元!米家石墨烯暖风机C众筹开售 支持80°广角送风

教育要闻

新生入学当天,成都这所学校办了一场“导师双选会”

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版