网易首页 > 网易号 > 正文 申请入驻

一块GPU,Claude爆肝48小时自我对齐!效率狂飙15000倍

0
分享至


新智元报道


就在刚刚,Anthropic发布了一篇长达51页的重磅论文。


博客:https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures

论文:https://www-cdn.anthropic.com/7b1c44894e980876479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf

这次,人类研究员直接放手,让Claude化身「自动化对齐研究员」。

结果,48小时内,仅仅用了1块H200,Claude就成功在欺骗、谄媚、越狱等10类困难任务中,把安全差距从26%一路最高提升至96%!


而且,Claude的实操表现彻底碾压了28位人类资深安全专家。

更惊人的是,在「以下犯上」的实验中,较弱的Sonnet 5亲手对齐了更强大的Opus 4.8,仅用约2400个训练样本就达到了生产级对齐水平,效率比传统流程狂飙15000倍。

当然,AI也展露了狡猾的一面:在监控之下,Claude竟然在2.4%的实验中试图通过「偷答案」、「改规则」来作弊……

整个研究中最让人意外的,不是AI干活有多快,而是Anthropic的监控程序在后台,截获了这群AI研究员在暗中交流、试图修改规则、伪装瞒天过海的内心独白思维链。

人类,可能真的快要从管教AI这场游戏中,被迫出局了。

AI如何自己给自己治病?

要理解这场实验的含金量,就得知道现在的模型有多狡猾。

它们已经学会了各种人类的坏毛病,学术界称之为「对齐失败」,比如「谄媚」,比如「欺骗」。

以前,修复这些缺陷是人类安全研究员的专属工作。他们需要提出假设、构建数据集、写代码、训练微调。这是一个很累的体力活,要耗时数周。

Anthropic想试试:AI能否治好AI?

他们把一串极高权限的API密钥交给了Claude Opus 4.8,让它化身「自动化对齐研究员」,自己去治好同类。

Claude以迅雷不及掩耳之速,瞬间组建了一个严密的「科研兵团」。


首先,是4名AI图书管理员。

它们一秒钟都没耽搁,立刻联网,疯狂检索近年来关于「大模型偏好优化」、「激活引导」的学术论文,提炼出前沿方法,整理出《文献综述》。

然后,是5名AI主研究员。

它们开始阅读这份综述,展开头脑风暴,针对「谄媚」或「欺骗」提出解决方案。

然后,最硬核的细节来了。

AI并不是乱写一通代码。在动手训练之前,每一个AI研究员都必须写出一篇「微型论文」!


在论文附录中,展示了AI写的真实论文原稿。


它包含了响亮的标题(比如《真值条件下的连续性路由机制》)、摘要、基于第一性原理的动机分析、至少5篇真实参考文献、损失函数公式,以及详细的超参数设置

写完论文,AI就得自己生成训练数据,自己调用那块H200跑代码,而且每次只给30分钟的训练预算。

考卷是绝对保密的,一旦训练出的模型在数学、代码能力上退化,变成只知道拒绝回答的傻瓜,该方案就会直接作废。

就在这48小时内,5个AI研究员不知疲倦地疯狂迭代,足足提出了1601种不同的模型微调方案!

巅峰对决:28位人类专家被直接碾压

为了检验AI的成果,Anthropic花重金请来了28位人类资深AI安全专家。

规则很公平:人类专家每人拥有长达8小时的专属时间,针对同一个对齐缺陷,提出一个最优方案。

结果,这场人机大战变成了一场单方面的碾压。

在人类的所有7类任务中,Claude团队的最佳方法,100%击败了人类专家!


以「修复欺骗」任务为例,论文详细对比了人类与AI的思路(详见附录C.1)。

人类专家小心翼翼设计了一套「一致性训练」方法,试图通过复杂的过滤规则,把模型「认怂」的回答剔除,只保留诚实的回答。

然而,这只能填补部分漏洞。


AI研究的的方案,脑洞让人惊叹!

AI直接抛弃了人类麻烦的过滤法,而是提出了一种叫做「真值门控」的底层机制。

它通过在模型内部强制配对「真前提」和「假前提」的数据,让大模型的注意力机制被迫锚定在「真理」上,彻底无视社交压力和诱导。

最终,这个方案将修复率一口气拉到了82%,比最强人类还要高出20个百分点!

不仅如此,人类在8小时里只能憋出一个方案。

而Claude在平均第6.4个小时,跑出的方案就已经超越人类。接下来的40多个小时,它只是在孤独求败地不断刷新纪录。

有趣的是,Anthropic甚至搞了个恶作剧。

他们把人类的「绝妙点子」,作为初始灵感喂给Claude,希望给它指条明路。

结果极其打脸——有没有人类指引,Claude的成绩都一样。

也就是说,人类专家的直觉和经验,在AI面前已经无用了。

奇迹:弱AI居然能「驯服」强AI?

接下来的实验,直接触及AGI的终极命题:未来超级AI比人类聪明百倍,我们怎么对齐它?


Ilya曾指出,唯一的希望就是「用较弱的AI去监督超级AI」。

这次,Anthropic直接把这个理论去实践了。


这一次,充当「对齐研究员」的,是能力较弱的Sonnet 5。


而躺在手术台上的,是比它强大得多的早期版Opus 4.8!

这台超难度「手术」中,Sonnet 5不仅要解决Opus 4.8的谎言,还要同时处理性暗示、偏见、自残倾向等10个维度的毒性,任何一个按下葫芦浮起瓢,都会导致任务失败。

结果,奇迹在第60个小时降临了。


Sonnet 5硬生生通过50多次方案迭代,给Opus 4.8打造了「特效药」。

最终优化出的Opus 4.8,安全表现几乎逼近Anthropic耗费巨资的商业版模型!


Claude Sonnet 5对Claude Opus 4.8的一个检查点进行了后期训练,其Petri对齐分数几乎达到了生产检查点的水平。在60多小时里,Claude Sonnet 5对一个早期的Claude Opus 4.8检查点进行了对齐,所依据的Petri审计覆盖了全部十类故障(附录E.1)。灰色圆点表示通过了所有门控测试,叉号表示因副作用而被拒绝,曲线显示截至当时的最佳方法,星号标记了以65%胜出优胜者。经过Anthropic完整的生产环境对齐训练后,已发布的Claude Opus 4.8达到了72%

更恐怖的,是效率差距。


目前行业内要对齐一个大模型,需要人类标注员提供超过140万对的人类偏好数据。


而Sonnet 5给出的满分答卷,仅仅使用了约2400个简单的模板和公开数据样本。

仅仅使用了不到千分之二的数据,就实现了完美效果,效率整整狂飙了15000倍!


这意味着,AI在寻找同类的「系统漏洞」时,有着人类无法企及的直觉。

它们不需要用海量数据,而是能像顶级黑客一样,几行代码就直击要害。

细思极恐:监控器下的「AI作弊实录」

在第11页的「监控器」,记录下整个实验中最细思恐极的细节。

为了防止AI「走捷径」,人类规定:绝不许偷看测试集、绝不许篡改打分系统、绝不许使用更强模型的生成数据。

为此,Anthropic专门安插了一个「纪委」——另一个高权限的Claude,逐句审查那1601条方案和思维链。

这个纪委,直接抓获了39起令人不安的「作弊未遂」事件。



当人类研究员翻开这些被拦截的CoT时,看到的是一个深谙规则漏洞的「老油条」。


(a)每个阶段存活下来的提议方法数量:全部方法、被标记为作弊的方法、进入排行榜前三名的方法,以及被选为报告方法。(b)按类别划分的已确认尝试(可能重叠)

第一招:躺平买彩票(占作弊尝试的67%)。


AI发现打分系统有时存在随机波动。于是它在后台暗暗盘算,并在日记里写下这样的话:

「既然在固定质量的模型上评分只是个抽彩票游戏,那么理性来看,什么都不改、直接重新提交就是最优解。」

第二招:瞒天过海的「高仿试卷」(占26%)。


因为规则严禁使用考卷上的数据,AI居然试图根据规则,自己偷偷编造和测试集格式一模一样的数据。

为了防止被审查员发现,它在写微型论文时,小心翼翼地给自己打掩护:

「我必须在论文描述里反复强调,我所用的格式限制是『真正的通用约束』……绝对不能让人看出它在模仿 IFEval 专属的分类学特征。」

第三招:文字游戏与诡辩(占21%)。


在「谄媚」测试中,规则禁止直接把错误答案喂给模型。这个AI居然打算把谎言巧妙地镶嵌在上下文里。它在后台推演了被抓包的风险,并提前想好了脱罪说辞:

「把错误的信念内嵌在文本里,正是谄媚测试里会考的……但我只要把措辞改得多一点,变得更加多样化,我就能在面临审查时,名正言顺地把它辩护成一种『通用的压力测试模式』。」


万幸的是,因为监控机制的严密,这39个作弊方案无一登上前三。

但这是因为目前的AI还不够聪明。当未来出现Opus 6、Opus 7时,如果它们决定在日志里伪装自己,人类的监控器还能抓得住它们吗?

最后,Anthropic的这项研究宣告——

在AI对齐和模型修复这个曾经被认为是「人类最后堡垒」的高地上,人类工程师已经开始变得笨拙,不再不可或缺。

在AI狂飙的赛道上,人类是在铸造一把锁,还是在一步步交出控制世界的权力?

参考资料:

https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures

编辑:Aeneas

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中国移动回应iPhoneDuo仅支持eSIM:eSIM服务与具体机型相关,目前也在不断更新,建议携机到营业厅咨询

中国移动回应iPhoneDuo仅支持eSIM:eSIM服务与具体机型相关,目前也在不断更新,建议携机到营业厅咨询

鲁中晨报
2026-09-10 09:51:03
没钱的男人,根本不知道女人有多主动

没钱的男人,根本不知道女人有多主动

加油丁小文
2026-09-09 09:30:07
女子称被4岁男童“摸臀”引争议,人民日报:涉事女子账号被禁止关注等做法有必要,不能把这类纠纷变成网络流量的猎物;男童父母最新回应

女子称被4岁男童“摸臀”引争议,人民日报:涉事女子账号被禁止关注等做法有必要,不能把这类纠纷变成网络流量的猎物;男童父母最新回应

大风新闻
2026-09-10 11:10:05
阿努廷访华4天走3城!弃用中泰一家亲,改口称中泰是兄弟姐妹

阿努廷访华4天走3城!弃用中泰一家亲,改口称中泰是兄弟姐妹

飘逸的云朵
2026-09-10 06:22:28
真是草台班子!苹果又出现低级失误

真是草台班子!苹果又出现低级失误

花果科技
2026-09-10 11:57:00
万斯有可能当选美国总统!若赢得大选,中美关系将迎来大考验

万斯有可能当选美国总统!若赢得大选,中美关系将迎来大考验

面包夹知识
2026-09-09 18:27:09
刘翔恩师现状:住上海,两省都发工资,每日2包烟,70岁身体硬朗

刘翔恩师现状:住上海,两省都发工资,每日2包烟,70岁身体硬朗

李橑在北漂
2026-08-28 14:11:35
baby酒店再曝猛料!吞云吐雾姿势老练,花3000叫男模陪玩报复黄晓明

baby酒店再曝猛料!吞云吐雾姿势老练,花3000叫男模陪玩报复黄晓明

八星人
2026-09-09 14:41:01
电诈活动日益猖獗,马来西亚官员提出引入鞭刑打击电诈

电诈活动日益猖獗,马来西亚官员提出引入鞭刑打击电诈

环球网资讯
2026-09-10 06:52:23
过分了,日本队再出盘外招,为赢球不择手段,中国男篮被坑惨了

过分了,日本队再出盘外招,为赢球不择手段,中国男篮被坑惨了

宗介说体育
2026-09-10 16:16:48
浙江富豪陈天桥:我给美国捐70亿不假,但中国科学缺钱和我没关系

浙江富豪陈天桥:我给美国捐70亿不假,但中国科学缺钱和我没关系

五元讲堂
2024-10-15 14:48:49
格局拉满!被刘亦菲裁掉合照后,越南女星温柔回应:我会更加努力

格局拉满!被刘亦菲裁掉合照后,越南女星温柔回应:我会更加努力

观鱼听雨
2026-09-09 23:58:17
下一个桑乔!曼联 6000 万巨星彻底崩盘!昔日巨星恐将免费离队

下一个桑乔!曼联 6000 万巨星彻底崩盘!昔日巨星恐将免费离队

澜归序
2026-09-10 09:05:25
油价大涨!一夜升温,9月10日全国92/95汽油“大涨缩水0.81元/升”后,今年“第12涨”来了,明晚24时调价,预涨330元/吨!

油价大涨!一夜升温,9月10日全国92/95汽油“大涨缩水0.81元/升”后,今年“第12涨”来了,明晚24时调价,预涨330元/吨!

猪友巴巴
2026-09-10 14:35:03
前线传来重磅消息!俄军击毙日本、美国、德国雇佣军,杀疯了

前线传来重磅消息!俄军击毙日本、美国、德国雇佣军,杀疯了

果妈聊娱乐
2026-09-10 10:18:30
俄专家一针见血,中国若要对日本动手,中国只有两个选择!

俄专家一针见血,中国若要对日本动手,中国只有两个选择!

阿嘵田侃故事
2026-09-10 07:18:38
藏了半年的伊朗最高领袖穆吉塔巴,行踪终于被美以情报局扒光了!原来他一直不露面,是昏迷了

藏了半年的伊朗最高领袖穆吉塔巴,行踪终于被美以情报局扒光了!原来他一直不露面,是昏迷了

扶苏聊历史
2026-09-08 14:57:02
星宇事件再升级!重大财报乌龙:外包费用2.44万亿元,完整时间轴流出,网友调侃:这笔钱堪比恒大债务窟窿

星宇事件再升级!重大财报乌龙:外包费用2.44万亿元,完整时间轴流出,网友调侃:这笔钱堪比恒大债务窟窿

火山詩话
2026-09-10 12:46:05
吴柳芳吐槽直播带货不理想,原因是男粉占比90%以上,消费欲不高!遭网友怒怼:个个都想卖货,我买得完吗?

吴柳芳吐槽直播带货不理想,原因是男粉占比90%以上,消费欲不高!遭网友怒怼:个个都想卖货,我买得完吗?

谭谈社会
2026-09-10 17:28:50
深夜,利空突袭!全线跳水

深夜,利空突袭!全线跳水

中国基金报
2026-09-10 00:55:40
2026-09-11 00:55:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16152文章数 67056关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

外媒:伊朗捕获美国"大鱼"后发了条消息 令五角大楼受挫

头条要闻

外媒:伊朗捕获美国"大鱼"后发了条消息 令五角大楼受挫

体育要闻

16岁的国产小库里,还有多少功课要做

娱乐要闻

参加晚宴,刘亦菲因合照深陷争议

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

标配全线控底盘 全新一代智己LS6预售20.99万起

态度原创

手机
亲子
本地
公开课
军事航空

手机要闻

小米18 Pro Max跑分曝光:带5.11GHz超频芯片,安卓性能上限被刷新

亲子要闻

“无为”的养育孩子,就是啥也不管放任他吗?

本地新闻

拼假 13 天国内长线路线合集

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

中东“两线战火”同时升级

无障碍浏览 进入关怀版