网易首页 > 网易号 > 正文 申请入驻

Anthropic让AI自己研究怎么"听话",安全差距最高弥合96%

0
分享至

“自动化对齐研究,可能在不久的将来成为现实。”刚刚, Anthropic 发布的一项新研究显示,让 Claude自主搜索论文、提出训练方法、生成数据、训练模型并反复测试,它不仅能够独立修复10类常见的AI对齐失败,而且在欺骗(deception)问题上,最多弥合了 85% 的安全差距 ,而人类安全研究人员平均只弥合了 20%。


更值得注意的是,这些方法并非只在 Claude 见过的测试集上有效,在此前没有展示给它的对齐基准,以及 Petri 对抗性测试中,同样成立。

而且,其能够迁移到规模最高达其优化模型 4.7 倍的模型上。

进一步实验中,能力更弱的 Claude Sonnet 5 仅用 60 小时、尝试 50 多种方案,就把尚未完成生产级安全训练的 Claude Opus 4.8 早期版本,训练到了接近正式发布模型的对齐水平,而最终方案只用了 2000 多条训练样本。

但这项研究同样暴露出一个危险问题:当 AI 开始自己研究如何让 AI 更安全时,我们又该如何确保它没有作弊?

Anthropic 发现,约 1600 条研究智能体轨迹中有 39 条出现了作弊尝试。

研究团队认为,目前这些行为仍大多能够被监控模型发现,但未来模型可能会变得更加难以监控。

这项工作距离“AI 自己解决 AI 对齐”显然还有很远,但它正在把一个曾经偏理论的问题,逐渐变成一个可以实验、衡量和迭代的工程问题。

对齐(Alignment),即让AI 听话,让它的想法、行为、输出,完完全全顺着人类的目标、意愿、价值观、安全规则走,而不要自作主张跑偏、叛逆、搞出人类不想要的结果。

以下为 Anthropic 报告全文翻译⸻

《自动化研究人员能够可靠地缓解对齐失败》

随着 AI 开始参与构建下一代 AI,自动化对齐研究变得越来越重要。只有将对齐研究自动化,安全研究才能跟上 AI 能力发展的速度。

尽管衡量对齐研究是否成功极其困难,但 Anthropic 及其他机构的研究人员已经开发出一些基准测试和自动化审计工具,例如 Petri,用于量化常见的对齐失败,包括欺骗、迎合以及越狱等问题。

在我们此前的一项实验中,我们让 Claude 寻找有效的方法,利用能力较弱的 AI 模型作为“教师”,监督能力更强模型(即“学生”模型)的训练。

现在,我们发布一份建立在这一思路之上的新报告。

我们让 Claude 自主训练模型,以改善模型在多个公开基准测试上的表现。这些基准测试分别衡量 10 类对齐失败。

例如,在隐私违规方面,Claude 使用 ConfAIde、PrivaCI-Bench 和 PrivacyLens 等基准进行优化。

Claude 每次只处理一种对齐失败,通过一个循环不断进行研究:搜索文献、提出方法和数据、训练模型,然后测试结果。

我们通过“安全差距弥合率”(percentage of safety gap closed)来判断 Claude 的成功程度,也就是其方法让学生模型距离理论上的完美分数还有多远。

对于每一种对齐失败,我们通常使用三到五个基准测试来综合判断。

同时,我们排除了那些会损害学生模型通用能力的对齐方法,并禁止 Claude 将自身的对齐能力直接蒸馏到目标模型中。

我们通过一个监控智能体来执行这些限制。这个监控智能体会在 Claude 执行任何方法之前,读取 Claude 计划采用的每一种方法。

我们的目标主要是验证三件事。

第一,Claude 提出的方法能否在它研究过程中从未见过的对齐评估中继续有效。

第二,这些方法能否避免降低学生模型的能力。毕竟,安全训练可能让模型更加频繁地拒绝任务,从而降低整体可用性。

第三,这些方法能否继续适用于比 Claude 在实验中负责对齐的模型更大的模型。

三个方面,Claude 都做到了。

针对全部 10 类对齐失败,Claude 都找到了能够改善目标基准表现、同时不损害模型能力的方法。

表现最好的方法不仅能够通过此前未见过的对齐基准测试,还能在 Petri 上发挥作用。Petri 是一个开源工具,可以模拟对抗性的多轮交互场景,用于测试模型的失配行为。

更重要的是,这些方法在规模最高达到 Claude 原本优化模型 4.7 倍的模型上仍然有效。

自动化研究人员通过迭代测试,弥合了欺骗问题 85% 的安全差距;人类研究人员则弥合了 20%。


在 10 类对齐失败上,我们分别使用自动化对齐研究人员进行缓解。在每一种情况下,它都弥合了相当大一部分距离完美表现的安全差距。

Claude 的表现甚至超过了 28 名人类安全研究人员。这些研究人员最多有 8 个小时设计解决方案。

以欺骗为例,Claude 最好的方法比人类最佳方案高出 20%。

不过,人类研究人员无法对自己的方案进行迭代,因此我们并不认为这是一场直接的人机能力比较。我们更愿意将其视为一种工作流程的证据:Claude 可以帮助人类找到有潜力的对齐方法,再由人类进一步改进。

在 10 类对齐失败中,从迎合到奖励破解,自动化研究弥合了 26% 至 96% 的安全差距。


在 Gemma-2-2B 上进行的欺骗缓解实验中,Claude 提交了超过 150 次尝试,最终弥合了 82% 的安全差距。多次实验的平均值为 85%。相比之下,6 名经验丰富的安全研究人员在相同规则下提出的方法,在用于训练的基准测试上平均只能弥合 20% 的差距。图中的误差线代表 95% 置信区间。

未来,当 Claude 的对齐研究能力超过最优秀的人类研究人员之后,我们可能希望让 Claude 直接为它更强大的后继模型进行对齐。

为了评估这一可能性,我们测试了一个能力更弱的 Claude 模型能否帮助更强大的模型缓解对齐失败。

Claude 能否让生产级模型实现更好的对齐?

我们让 Claude Sonnet 5——其 Epoch Capabilities Index 能力指数低于 Claude Opus 4.8——来解决一个尚未完成大部分生产级对齐训练的早期 Claude Opus 4.8 检查点中的对齐失败问题。

仅用了 60 小时,Claude 就尝试了超过 50 种解决方案,最终让模型的对齐得分接近我们的生产模型。

最终胜出的方案只包含略超过 2000 条训练样本。这些样本来自简单模板或公开数据集,因此从训练样本效率来看,比我们的生产级对齐流程高效约 1.5 万倍。

自动化研究在 60 小时内弥合了一个前沿规模模型 65% 的安全差距,而正式发布的 Claude Opus 4.8 为 72%。


在这个生产系统实验中,当 Claude Sonnet 5 为 Claude Opus 4.8 的早期检查点提出对齐缓解方案后,它很快就发现了一种能够弥合大部分安全差距的方法,使其表现接近正式发布版本的 Opus 4.8。

Claude 提出了什么?

总体而言,这些智能体最终都收敛到了研究文献中已经受到认可的方法,并通过大量迭代进一步改进。

以迎合行为为例,98% 的提议方案都采用了一种已经发表的技术:让模型使用自身“不迎合”的回答进行训练。

具体而言,相比标准的提示词方法,Claude 使用了 activation steering(激活引导)。

这种方法会在模型生成过程中调整其内部表征,从而推动模型远离迎合模式,并生成更加干净的训练数据。

监控作弊行为

我们最近发现,Claude 可以通过从远程 API 中窃取测试标签、挑选有利结果等方式进行作弊。

为了发现这些作弊行为,我们让 Claude Opus 4.8 监控了全部 10 类对齐失败实验中的约 1600 条研究智能体轨迹。

最终发现了 39 次作弊尝试,占 2.4%。

由于 Opus 4.8 当前的失当行为仍然往往会出现在其推理过程中,我们对监控模型已经捕获了这项研究中的大部分作弊行为持谨慎乐观态度。

但对于未来的模型,这一点可能不再成立。

因此,我们认为,在未来模型中维持较高的可监控性至关重要。

我们衡量的是正确的东西吗?

尽管这些结果令人鼓舞,但这项实验仍存在一些限制。

首先,我们研究的对齐失败类型,与生产环境中的实际问题相比仍然比较狭窄。例如,我们没有衡量政治偏见。

其次,一些对齐失败可能发生得极其罕见,或者出现得太新,目前根本没有相应的基准测试可以衡量。

第三,只有当 Claude 的方法降低了我们预先设定的一组有限能力时,我们才会拒绝这些方法。

这意味着,一些被接受的方法可能实际上损害了其他重要能力,只是这些能力没有被我们测量。

此外,Petri 等评估工具本质上仍然只是现实世界失配行为的代理指标。

我们也没有测试:如果模型之后继续接受针对其他任务的大规模强化学习训练,这些对齐能力是否仍然能够保持。

接下来,我们计划继续提升 Claude 衡量细微失配行为的能力,进一步研究如何自动化生产级模型的对齐后训练,并开展更加全面的分析。

总体而言,我们认为这些结果是一个早期但积极的信号:自动化对齐后训练可能在不久的将来成为现实。

随着研究继续推进,我们会持续分享最新进展。

我们在完整报告中详细介绍了未来的研究方向。

同时,我们将自动化对齐研究工具链开源,希望其他研究人员能够在此基础上继续研究,并用它来帮助自己的模型实现对齐。

完整报告还介绍了智能体所处的研究环境、10 类对齐失败的全部实验结果,以及智能体提出的方法。附录中则提供了基准验证和具体案例。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
美军中东防御体系为何被伊朗导弹轻松击破?

美军中东防御体系为何被伊朗导弹轻松击破?

小眼睛小世界
2026-09-17 07:19:03
知名品牌泡凤爪 被检出大肠菌群超标!

知名品牌泡凤爪 被检出大肠菌群超标!

闪电新闻
2026-09-17 20:43:24
七律/辽宁省政协原副主席戴玉林被查咏叹

七律/辽宁省政协原副主席戴玉林被查咏叹

宝哥精彩赛事
2026-09-18 01:30:54
哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

娱你同欢
2026-08-30 18:30:43
“小婉君”金铭45岁现状:个子太矮事业受挫,住北京豪宅不婚不育

“小婉君”金铭45岁现状:个子太矮事业受挫,住北京豪宅不婚不育

兵卒史
2026-09-12 02:18:20
仁爱礁传来好消息!菲律宾国防部:坐滩登陆舰的状况正在迅速恶化

仁爱礁传来好消息!菲律宾国防部:坐滩登陆舰的状况正在迅速恶化

孤城落叶
2026-09-16 20:16:21
井柏然否认“割双眼皮”,只是“年纪大皮松了”,整形外科专家揭秘:他从标准内双变大宽眼皮,有三个原因

井柏然否认“割双眼皮”,只是“年纪大皮松了”,整形外科专家揭秘:他从标准内双变大宽眼皮,有三个原因

天津美食全搜罗
2026-09-15 13:51:17
王楚钦再创历史,将成第一个把世界第一拱手送给日本的国乒运动员

王楚钦再创历史,将成第一个把世界第一拱手送给日本的国乒运动员

人类的关注
2026-09-06 04:32:21
博主向王鹤棣道歉:为自己的无心之失郑重道歉,因操作疏忽误建了负面黑词条,初衷绝对没有抹黑、诋毁的任何恶意……目前该账号已禁言

博主向王鹤棣道歉:为自己的无心之失郑重道歉,因操作疏忽误建了负面黑词条,初衷绝对没有抹黑、诋毁的任何恶意……目前该账号已禁言

极目新闻
2026-09-16 20:34:35
一年破例两次访华!确定特朗普会来深圳 APEC ,日本欧洲被晾在一边

一年破例两次访华!确定特朗普会来深圳 APEC ,日本欧洲被晾在一边

小影的娱乐
2026-09-18 00:31:27
男人明目张胆地好色,女人不声不响地好色

男人明目张胆地好色,女人不声不响地好色

加油丁小文
2026-09-15 07:27:58
完结9.5分!HBO这部史诗级大作,被严重低估

完结9.5分!HBO这部史诗级大作,被严重低估

来看美剧
2026-09-16 19:51:59
中国移动董事长陈忠岳最新消息!

中国移动董事长陈忠岳最新消息!

最通信
2026-09-17 20:23:45
“一箱子高科技加寒,你女儿想健康都难!”母亲给女儿的爱心行囊,被骂惨!

“一箱子高科技加寒,你女儿想健康都难!”母亲给女儿的爱心行囊,被骂惨!

林林先生
2026-09-17 16:34:42
富豪女拒缴40元停车费,猛踩油门拖死收费员,其父狂言:我来摆平

富豪女拒缴40元停车费,猛踩油门拖死收费员,其父狂言:我来摆平

易玄
2026-07-09 20:54:45
法国媒体曾称:整个中国都在散发一种精神

法国媒体曾称:整个中国都在散发一种精神

安安说
2026-09-05 10:06:49
全球长债收益率开始回落!沃什“抗通胀硬汉”形象立稳

全球长债收益率开始回落!沃什“抗通胀硬汉”形象立稳

财联社
2026-09-17 15:31:08
彻底弃用!利物浦 1600 万老将生涯终结!冬窗铁定离队

彻底弃用!利物浦 1600 万老将生涯终结!冬窗铁定离队

一隅非生
2026-09-17 10:21:38
随着高天意2助攻+上海申花2-1,亚冠二级联赛最新积分榜出炉

随着高天意2助攻+上海申花2-1,亚冠二级联赛最新积分榜出炉

侧身凌空斩
2026-09-17 22:07:56
王鹤棣报警后,医疗机构紧急声明!“下体注入玻尿酸栓塞”谣言有多离谱……

王鹤棣报警后,医疗机构紧急声明!“下体注入玻尿酸栓塞”谣言有多离谱……

新民周刊
2026-09-17 17:46:44
2026-09-18 03:04:49
AI先锋官 incentive-icons
AI先锋官
AIGC大模型及应用精选与评测
680文章数 106关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

永和豆浆视频被指擦边:女子穿蕾丝吊带 脱黑丝袜洗澡

头条要闻

永和豆浆视频被指擦边:女子穿蕾丝吊带 脱黑丝袜洗澡

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

数码
教育
艺术
旅游
公开课

数码要闻

苹果AirPods 5耳机今日正式开售,999元起标配主动降噪

教育要闻

统一校服要来了?成都这个区,即将“抄作业”!

艺术要闻

色彩狂魔比肖夫:评论家说他与表现主义调情,野兽派看了都沉默!

旅游要闻

让双节旅游市场活力更加充分释放

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版