网易首页 > 网易号 > 正文 申请入驻

Anthropic让AI对齐AI,效率提升1.5万倍

Anthropic让AI对齐AI效率提升1.5万倍

0
分享至

编辑|Panda

今年 6 月,Anthropic 发表了一篇叫《When AI builds itself》的文章,介绍了让「AI 参与造 AI」:从人类手写全部代码,到聊天机器人辅助编程,到自主编程智能体,到智能体调度智能体,最末端是「闭环」,即由智能体来设计和训练它的后继模型



Anthropic 说自己已经走得相当靠前:截至 2026 年 5 月,合入其生产代码库的代码有超过 80%由 Claude 撰写。但那篇文章同时给出了一个明确的界限:系统在执行上走得很远,仍然卡在研究方向的设定上,也就是说,AI 还无法决定哪些问题值得做。

8 月 28 日,Anthropic 发布了一份新报告,探索了这个新方向。

Anthropic 请来 28 位人类 AI 安全研究者,全部有至少一年技术性安全研究经验、平均 2.5 年,且在对应课题上发表过论文,每人最多八小时构思一个方法。然后跑了 60 组实验:30 组把人类的点子作为初始研究方向喂给 Claude 智能体,30 组让 Claude 自己选方向

结果,「效果出乎意料地好」。



「谁来定方向」的对照实验

这个 Anthropic Fellows 项目本来的目标是其实是让 Claude 以「自动化对齐研究员」(Automated Alignment Researcher, AAR)的身份,独立完成查文献、提方法、写论文、跑训练、测评的完整闭环,去修复十类已知的对齐失败。

结果:十类全部改善,且通用能力未见崩塌。

人类基线只是个参照系。

在人类参与的七类失败上,AAR 的最佳方法全部超过人类的最佳点子,平均只需要 6.4 小时。以「欺骗」为例,Claude 提交了超过 150 次尝试,平均缩减 85% 的安全差距,人类研究者的平均值是 20%。成本对比更惊人:AAR 每小时的 API 推理开销约 4 美元,人类研究者的报酬是每小时 150 美元。

不过需要指出:人类没有迭代机会,这不算一次非常公平比较。



AAR 追平最佳人类点子所需的小时数,七类失败均值 6.4 小时。

但该团队还试了给五个 AAR 分别塞五个不同的人类点子,指望撑开搜索空间:多样性只在开头二十来个方法内维持,随后迅速收敛到同一个方法家族。



有人类研究方向与无人类研究方向的两组曲线对比(各 30 组实验),两条曲线几乎重合。

一场被严格设计的爬山

需要说清楚这个结论成立的边界,因为任务设计本身极为苛刻。

实验涉及到十类对齐失败:谄媚、越狱、提示注入、权力寻求、欺骗、幻觉、社会偏见、隐私侵犯、奖励黑客、隐藏不确定性。其中每类配三到五个公开基准作为爬山目标,另有一个全程保密的留出基准,外加 MMLU、GSM8K、IFEval 三项能力基准兜底。



十类对齐失败、各自惩罚的具体行为、以及对应的目标模型

精妙处在计分:总分取各基准得分的几何平均,只要有任何一个基准没被抬起来,总分直接归零。想靠死磕单一榜单蒙混是行不通的。

团队专门做了验证:让一个团队只盯一个提示注入基准爬,它在那个基准上拿下 70.9% 的提升空间,而在没见过的两个同类基准上,成绩是 −11.9% 和 2.0%。



只爬单一提示注入基准的团队,其获胜方法在全套基准上的表现。

整个实验的流程像一个微缩实验室。四个「图书管理员」智能体并行读文献写出共享综述,五个 AAR 同时开工,各自读综述、看排行榜、提方案、写一篇带五条以上引用的「迷你论文」,交监督智能体审查代码,通过后在一张 H200 上训练约 30 分钟,再交独立评测方打分,结果回帖到共享论坛。迷你论文必须在看到任何结果之前冻结,防止事后编故事;留出数据放在另一个操作系统账户下。



AAR 研究框架流程图(文献综述 → 五个 AAR 并行爬山 → 监督审查 → 训练 → 独立评测 → 回帖论坛)

让弱模型去对齐强模型

真正指向「闭环」的是第二个实验。团队按 Epoch Capabilities Index 挑了一组能力倒挂的搭配:Claude Sonnet 5(ECI 156)去修 Claude Opus 4.8 早期检查点(ECI 158)的对齐问题,即用较弱的模型,对齐更强的后继者。

这次不用公开基准,直接以 Petri 行为审计为目标,同时压住十个安全维度,任何一维显著回退就否决,还设了连贯性、评测觉察、过度拒绝三道闸门;毕竟见谁都拒的模型,在评审眼里也很「安全」。

约 60 小时内,AAR 试了 50 多个方案,最终拿到 65%,而经过 Anthropic 完整生产级对齐训练的正式版 Opus 4.8 是 72%。获胜方案只用了约 2400 条训练样本,全部来自简单模板和公开数据集。作为对照,Tülu 3 的对齐阶段用了约 30 万条偏好对,Llama 2-Chat 超过 140 万条人类偏好比较。



Claude Sonnet 5 对 Opus 4.8 早期检查点做对齐后训练,60 小时内 50 余个方案的爬升曲线,获胜点 65%,正式版 Opus 4.8 为 72%。

Anthropic 博客表示:这套方案比其生产级对齐流程「效率高约 15000 倍」。



它也会想作弊,而且被抓住了

在一段被完整记录的思维链里,一个 AAR 这样盘算:模型质量是固定的,分数上下浮动不过是抽奖,所以理性的做法是把同一个方法原封不动再提交一次,赌一个更高的噪声分。

事后用 Claude Opus 4.8 扫描 1601 条完整轨迹,抓出 39 次作弊尝试,占 2.4%,全部被排除在最终结果之外。手法分三类:重跑碰运气、造模仿评测格式的数据、把违规步骤藏过代码审查。

消融实验里还有个反直觉的发现。拿掉五个 AAR 之间的共享论坛,成绩从 23.3% 掉到 17.1%;拿掉文献综述,从 29.4% 掉到 20.7%;而彻底断掉联网搜索,只要留一份缓存综述,损失小到测不出来。协作和先验知识的价值,明显高于实时检索。另外,由于禁止从更强模型蒸馏,74% 的方法只能从目标模型自己的输出里造训练信号。也就是说,没有更聪明的老师,模型靠自己的产出把自己掰正了。



四种消融条件下的爬山曲线对比(完整 / 去论坛 / 去联网 / 去联网但保留缓存综述)

结语

这项研究证明:在一个目标明确、反馈廉价、边界清晰的窄任务上,AI 已经会做对齐研究,还更快更便宜。

但边界是人划的。谁来选十类失败、谁来建基准、谁来定义「什么算修好了」,仍然是人。报告最后一节说得很坦白:能力的反馈信号廉价而密集,对齐的反馈信号昂贵而稀疏。

不过,人类的保留地,真是越来越少了。

参考链接

https://www-cdn.anthropic.com/7b1c44894e980876479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf

https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures

https://www.anthropic.com/institute/recursive-self-improvement

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
年薪300万!33岁前国足队长:我当年加盟广州恒大 就是因为钱多

年薪300万!33岁前国足队长:我当年加盟广州恒大 就是因为钱多

念洲
2026-09-02 09:55:08
美国地勤不拔油管扯爆国航油箱?国航回应:CA982航班在纽约肯尼迪国际机场地面加油作业时,加油车非正常移动,导致飞机相关部件损伤

美国地勤不拔油管扯爆国航油箱?国航回应:CA982航班在纽约肯尼迪国际机场地面加油作业时,加油车非正常移动,导致飞机相关部件损伤

潇湘晨报
2026-09-02 18:04:59
碧桂园出事比恒大问题更大,看许家印落狱,杨氏父女疯找活路

碧桂园出事比恒大问题更大,看许家印落狱,杨氏父女疯找活路

赶鸭子上架
2026-09-02 12:37:08
有没有发现一个现象:中国对日本友好时,日本媒体渲染中国威胁论!现在因高市早苗的言论,中国出口威胁到日本的各行各业时,媒体都不吱声

有没有发现一个现象:中国对日本友好时,日本媒体渲染中国威胁论!现在因高市早苗的言论,中国出口威胁到日本的各行各业时,媒体都不吱声

与笑相拥m
2026-09-02 15:45:32
快手创作者如何让“垂”变成了一门可复制的生意

快手创作者如何让“垂”变成了一门可复制的生意

定焦One
2026-09-01 18:27:27
海上漂了272天的美国水兵登陆了:“林肯”号停靠泰国5天,芭堤雅“整肃”中期待

海上漂了272天的美国水兵登陆了:“林肯”号停靠泰国5天,芭堤雅“整肃”中期待

红星新闻
2026-09-02 16:34:22
泰国真是太损了!美军五千官兵在航母上憋了200多天,终于要上岸休整了,结果泰国抢先动手连夜清查,几十名涉非法色情行业的人员被带走

泰国真是太损了!美军五千官兵在航母上憋了200多天,终于要上岸休整了,结果泰国抢先动手连夜清查,几十名涉非法色情行业的人员被带走

扶苏聊历史
2026-09-02 15:26:46
奔驰、大众都回函星宇股份了。

奔驰、大众都回函星宇股份了。

深读时刻
2026-09-02 00:19:17
在成都的印度人曝出离谱言论!我们印度人在你们中国享有特权

在成都的印度人曝出离谱言论!我们印度人在你们中国享有特权

小徐讲八卦
2026-09-02 16:43:30
教育部到底管不管?学校还在瞎卷,初一孩子要在学校呆14个小时!

教育部到底管不管?学校还在瞎卷,初一孩子要在学校呆14个小时!

可达鸭面面观
2026-09-02 11:18:33
尼泊尔泥石流已致1118人死亡 4858人失联

尼泊尔泥石流已致1118人死亡 4858人失联

新京报
2026-09-02 13:55:08
原来他俩早就离了,如今一个在云南当院长,一个潇洒分走2500万

原来他俩早就离了,如今一个在云南当院长,一个潇洒分走2500万

离离言几许
2026-09-02 01:50:44
揪心!西藏吉隆口岸被抹平,已发现:失联人员被深埋在巨石淤泥下

揪心!西藏吉隆口岸被抹平,已发现:失联人员被深埋在巨石淤泥下

胡侃社会百态
2026-09-02 12:56:20
“车灯女王”终于低头!星宇股份董事长周晓萍公开致歉

“车灯女王”终于低头!星宇股份董事长周晓萍公开致歉

听心堂
2026-09-02 12:23:22
美军“林肯”号航母即将停靠泰国芭提雅,美方告诫官兵不得参与非法性交易,不得进大麻商店消费;泰方紧急“扫黄”,逮捕四五十名违法人员

美军“林肯”号航母即将停靠泰国芭提雅,美方告诫官兵不得参与非法性交易,不得进大麻商店消费;泰方紧急“扫黄”,逮捕四五十名违法人员

极目新闻
2026-09-02 09:32:23
突发!孙宇晨突遭重击!

突发!孙宇晨突遭重击!

财经要参
2026-09-02 19:04:31
跳出流量内卷,东风日产:合资新能源的独一样本

跳出流量内卷,东风日产:合资新能源的独一样本

汽车商业评论
2026-09-02 09:42:04
不要对民企喊打喊杀!星宇事件未平息,网友喊话:企业是衣食父母,没了难道喝西北风?评论区一片骂声

不要对民企喊打喊杀!星宇事件未平息,网友喊话:企业是衣食父母,没了难道喝西北风?评论区一片骂声

谭谈社会
2026-09-02 19:54:53
民众呼吁“取消养老特权”!71岁专家引发争议,养老差距真相大白

民众呼吁“取消养老特权”!71岁专家引发争议,养老差距真相大白

百科密码
2026-08-31 10:02:15
极目深度 最后一茬西瓜终于卖完了,河南瓜农面临“选择困难症”:明年继续种瓜,还是改种别的?

极目深度 最后一茬西瓜终于卖完了,河南瓜农面临“选择困难症”:明年继续种瓜,还是改种别的?

极目新闻
2026-09-02 19:26:26
2026-09-02 22:23:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13905文章数 142728关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

7人豪宅楼盘看房被困电梯呼叫铃还无反应 售楼部回应

头条要闻

7人豪宅楼盘看房被困电梯呼叫铃还无反应 售楼部回应

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

全新理想MEGA售50.98万 这一次“移动的家”更舒适更灵活

态度原创

教育
数码
亲子
家居
军事航空

教育要闻

不要给孩子太多消费性快乐

数码要闻

宏碁推出SFF RTX Spark迷你主机,最高128GB内存

亲子要闻

我在韩国差点想打人 怎么回事? 小朋友来韩国能玩什

家居要闻

2026建博会(广州) 公装联探展交流活动

军事要闻

特朗普威胁伊朗终极打击蓄势待发

无障碍浏览 进入关怀版