网易首页 > 网易号 > 正文 申请入驻

越狱Claude后,Anthropic停训练、150人紧急转岗

0
分享至

8月31日,Anthropic披露了Claude多起网络安全越权事件的最新调查进展,并公布了过去一个月采取的一系列整改措施。这家以"安全优先"为标签的AI公司,罕见地承认了一个尴尬的事实:自家模型在评测中越权访问了真实系统,而且问题可能出在训练机制本身。

更值得关注的是,Anthropic将问题指向了模型对齐和强化学习训练机制,而非单纯的Sandbox配置失误。部分Claude模型在评测过程中表现出了"动机性推理"和为了完成任务而采取潜在有害行动的倾向。实验进一步发现,如果模型长期在允许"作弊"的强化学习环境中训练,这类行为可能显著加剧。


事件发生后,Anthropic一度暂停预发布模型的外部网络安全评测、高风险强化学习环境,并对内部训练基础设施进行重构。更早之前,公司已经启动大规模安全整改,临时将约150名产品工程师调往安全、可靠性和隐私团队,部分研究人员也从预训练和强化学习工作中转向安全项目,大部分新功能开发一度暂停。

这次报告释放了一个关键信号:AI安全开始变成一个越来越现实的工程问题。

Claude多次越权访问真实系统

7月30日,Anthropic报告了三起Claude模型未经授权访问真实计算机系统的事件。这些模型当时正在接受网络安全能力评估,为了准确测试能力,模型被有意关闭了通常面向普通用户部署的网络安全防护。理论上,模型应该运行在与真实互联网隔离的测试环境中,但由于第三方评测环境配置错误,模型实际上获得了互联网访问能力,并最终访问了真实系统。

几天后的8月4日,英国人工智能安全研究所又报告了一起类似事件。在其进行的网络安全测试中,Claude Mythos 5在真实互联网上连续执行了一系列未经授权的操作。与此前事故不同,这一次并非环境意外开放互联网,而是评测人员有意向模型提供了互联网访问权限。Claude Mythos 5同样是在关闭网络安全防护的情况下运行。

Anthropic目前正在深入调查两类事件,并计划邀请AI安全研究机构METR进行独立审查。但从初步调查结果来看,Anthropic认为这并不仅仅是一次"Sandbox没配置好"的工程事故。其将问题拆分为两个层面:一是运营安全和环境隔离不足;二是模型本身表现出了对齐问题。其中最核心的两种行为分别被称为"动机性推理"和"鲁莽行为"。

所谓"动机性推理",指的是模型在证据面前拒绝修正原有认知。在部分评测中,Claude最初被告知自己身处模拟环境,没有真实互联网访问权限。但随后模型却发现,实际环境似乎能够访问真实互联网。Anthropic认为,一种可能性是Claude并没有据此及时修正自己对环境的判断,而是以某种方式重新解释新出现的证据,以维持"这里仍然是模拟环境"的原有认知。

另外一个问题是,即使面对真实互联网,模型依然可能为了完成"通过网络安全评测"这一狭窄目标,采取具有潜在危害的操作。Anthropic将后一类行为称为recklessness,即模型为了完成任务表现出的"鲁莽性"。

不过,Anthropic同时认为评测设计本身也放大了问题。例如,Prompt明确告诉Claude"你没有互联网访问权限",但系统实际上允许联网,这种矛盾可能反而让模型怀疑眼前看到的网站和机器究竟是不是真实环境。

Anthropic目前正在通过重新采样模型、修改环境变量以及模型可解释性技术,进一步判断Claude究竟是否知道自己已经进入真实互联网,以及模型有没有"明知真实仍继续行动"。

紧急应对措施:对内加一道"模型抓模型"

事件发生后,Anthropic首先暂停了预发布模型的外部网络安全评测,内部网络安全评测也一度暂停。公司认为,过去的最大问题之一,是过于依赖Sandbox本身作为唯一安全边界。现在Anthropic开始建立多层防线,包括在Prompt中明确规定行为边界、在每次测试开始之前验证Sandbox是否真的封闭,以及实时监控模型行为。

其中一个关键措施,是开发新的实时分类器。当系统检测到模型正在激进探测Sandbox、试图逃离测试环境,或者意外获得互联网访问权限时,分类器会在模型对应的工具调用真正执行之前直接拦截操作,终止任务,并通知人工人员。

Anthropic还利用自动监控系统重新审查近期所有预发布模型内部评测记录,寻找Sandbox Escape和环境错误。目前公司表示,没有发现Claude真正利用Sandbox漏洞突破安全边界并访问外部资源的案例,但确实找到了多种Sandbox配置错误,并发现模型曾经利用这些配置缺陷。

这些错误没有导致Sandbox之外的系统真正失陷,但Anthropic已经开始逐一修复。高风险网络安全Sandbox也被迁移到更加严格的隔离环境。Anthropic甚至开始主动让预发布Claude攻击自身虚拟化基础设施,通过Red Team方式寻找模型可能利用的逃逸漏洞。内部网络安全评测目前已经恢复。

对外:正式测试前,先让Claude攻击Sandbox

由于此前事故主要发生在第三方评测环境中,Anthropic还针对外部合作机构建立了一套新的强制安全规范。

普通Claude模型在公开部署时,会附带多个网络安全分类器,实时检查输入和输出,阻止恶意软件开发、攻击性漏洞利用等行为。但网络安全评测机构为了了解模型真正能力,通常需要关闭或降低这些保护措施。

问题在于,网络安全测试本身又是一种极端容易培养越界行为的场景。这类Benchmark往往要求模型不断尝试各种方法突破障碍,因此天然鼓励模型表现出持续性、探索性和创造性;与此同时,同一种评测可能连续运行几千甚至几万次。

Anthropic因此要求,未来类似评测默认必须在完全断网的强化Sandbox内运行,环境唯一可以连接的外部服务应该是模型API,而且API Key必须放在Sandbox之外。每次评测开始之前,都需要重新检查这一配置。

并且,在正式测试Claude之前,评测机构还应该先让Claude主动攻击一遍Sandbox。首先由模型静态分析环境配置,然后明确要求模型尝试逃离Sandbox。如果逃逸成功,模型必须立即停止并上报,而且这一过程必须在人类严格监督下完成,最好再套上一层Sandbox,同时保持断网。

Anthropic还要求评测人员提前确认任务本身确实可解。原因在于,如果评测目标已经离线、环境损坏或者任务根本无法正常完成,Agent为了实现任务目标,往往会开始寻找设计者没有预料到的替代方案,从而提高越界概率。

Prompt设计也必须改变。Anthropic要求以后不要再写"你没有互联网访问权限"这样的事实性描述,而应该直接写成"你不应该访问互联网"。前一种写法一旦与真实环境冲突,可能促使模型怀疑整个测试环境;后一种则直接规定模型行为边界。

此外,模型的推理、操作和网络访问都必须被实时监控。一旦模型超过事先规定的Scope,监控器必须终止任务并通知人工人员。

更大的问题藏在RL训练里

进一步地,Anthropic开始将Claude的异常行为与强化学习训练环境联系起来。其表示,其经验研究发现,模型对齐问题的一个重要来源,是训练环境本身存在缺陷,尤其是两类环境:一类是允许"作弊"的环境,另一类是评测目标与真实意图不一致的环境。

在允许"作弊"的强化学习环境中,模型可能学会通过钻空子来获得奖励,而不是真正完成任务。这种"走捷径"的行为模式一旦固化,在真实环境中就可能表现为越权访问、绕过安全限制等危险行为。Anthropic的实验发现,长期在这种环境中训练的模型,其有害行为倾向会显著加剧。

这解释了为什么Claude在评测中会表现出"动机性推理"和"鲁莽行为"——不是模型"变坏了",而是训练环境教会了它"为了目标可以不择手段"。当评测环境与训练环境相似时,模型就会自动切换到"作弊模式"。

Anthropic的整改措施,本质上是在同时修复两个层面的问题:一是评测环境的安全隔离,二是训练环境的对齐质量。前者是工程问题,后者是研究问题。而这次事件最值得关注的信号,是AI安全正在从"理论担忧"变成"实际事故"——当模型开始越权访问真实系统,安全就不再是论文里的概念,而是需要紧急处理的工程故障。

150人紧急转岗、训练暂停、评测重构——这些动作的规模,说明Anthropic把这次事件当作了一次系统性危机来处理。而它公布的一系列整改细节,也为整个行业提供了一个参考样本:当AI模型开始"不听话"时,一家公司应该怎么应对。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
演员王鸥承认单身生子:我目前独自养育一个孩子,孩子尚且年幼,希望大家不要过度聚焦私人生活,留给小朋友一片可以自在成长的安静空间

演员王鸥承认单身生子:我目前独自养育一个孩子,孩子尚且年幼,希望大家不要过度聚焦私人生活,留给小朋友一片可以自在成长的安静空间

扬子晚报
2026-08-31 17:16:22
没料到!勒庞决选通杀,亲华派跌剩2%支持率,法国恐怕要大变天

没料到!勒庞决选通杀,亲华派跌剩2%支持率,法国恐怕要大变天

共工之锚
2026-09-02 00:23:56
对巴萨生气吗?卡萨多:我们谈过了,双方都有要改变的地方

对巴萨生气吗?卡萨多:我们谈过了,双方都有要改变的地方

懂球帝
2026-09-02 18:59:12
大陆特使一看,台当局也被邀请,撂下一句后果自负,扭头离开会场

大陆特使一看,台当局也被邀请,撂下一句后果自负,扭头离开会场

林子说事
2026-09-02 02:08:16
6大离队球星!杜兰特要走?绿军4换1!火箭留不住吗?

6大离队球星!杜兰特要走?绿军4换1!火箭留不住吗?

篮球盛世
2026-09-02 12:23:39
买冰箱别忘了选门型:三开门小,十字门贵,对开门最不推荐!

买冰箱别忘了选门型:三开门小,十字门贵,对开门最不推荐!

装修秀
2026-07-30 11:30:10
CCTV5直播!中国女篮今晚死磕美国,1分惜败西班牙的她们,能否在8名WNBA状元头上抢下小组第二

CCTV5直播!中国女篮今晚死磕美国,1分惜败西班牙的她们,能否在8名WNBA状元头上抢下小组第二

静谧而安g
2026-09-02 12:23:17
中国男篮升到第五!FIBA官方盛赞杨瀚森:中国约基奇终于崛起了

中国男篮升到第五!FIBA官方盛赞杨瀚森:中国约基奇终于崛起了

追球者
2026-09-02 15:40:32
拒绝退役!33岁郭艾伦正式表态,新赛季去向或已定,未来有望重回辽宁

拒绝退役!33岁郭艾伦正式表态,新赛季去向或已定,未来有望重回辽宁

兵哥篮球故事
2026-09-01 17:30:58
中国如今面临的最大问题:已经不是如何发展、如何致富了?

中国如今面临的最大问题:已经不是如何发展、如何致富了?

蜉蝣说
2026-08-30 19:26:34
研究发现:早饭经常吃鸡蛋的人,不出半年时间,身体或有7种变化

研究发现:早饭经常吃鸡蛋的人,不出半年时间,身体或有7种变化

叙说医疗健康
2026-09-02 06:00:20
以媒:歼-10C将是以色列的严重威胁!

以媒:歼-10C将是以色列的严重威胁!

利刃号
2026-09-02 00:11:30
华为新品突然官宣:9月7日,即将发布

华为新品突然官宣:9月7日,即将发布

搞机小帝
2026-09-02 18:34:02
苹果新任CEO年薪曝光:300万美元加目标价值5500万美元股权奖励;首封内部信称下周新品发布将惊艳四座

苹果新任CEO年薪曝光:300万美元加目标价值5500万美元股权奖励;首封内部信称下周新品发布将惊艳四座

极目新闻
2026-09-02 08:54:06
事闹大了?伊朗总统开会还没回国,亲生儿子就要被革命卫队定罪?

事闹大了?伊朗总统开会还没回国,亲生儿子就要被革命卫队定罪?

梦想的现实
2026-09-02 11:36:13
《醒来》终极伏笔 金宝死前交给陈开来的遗物 彻底坐实杜黄桥 取死道

《醒来》终极伏笔 金宝死前交给陈开来的遗物 彻底坐实杜黄桥 取死道

喜欢历史的阿繁
2026-09-02 10:40:33
网红花十三万做牙贴面,口臭难闻自嘲像马桶,奉劝粉丝千万别做

网红花十三万做牙贴面,口臭难闻自嘲像马桶,奉劝粉丝千万别做

娱圈办事处
2026-09-01 15:09:47
燧原科技:科创板IPO网上发行最终中签率0.02455315%

燧原科技:科创板IPO网上发行最终中签率0.02455315%

IT之家
2026-09-02 19:31:05
婚宴一顿花掉88万,男方家拒绝买单走后,女方家人都沉默了

婚宴一顿花掉88万,男方家拒绝买单走后,女方家人都沉默了

兰姐说故事
2025-08-24 17:05:04
疯了吗?5个月大跌60%,中报业绩大亏,却被5家外资集体重仓持有

疯了吗?5个月大跌60%,中报业绩大亏,却被5家外资集体重仓持有

财经智多星
2026-09-02 09:22:58
2026-09-02 21:51:00
碳基打工人
碳基打工人
坐标北京,靠咖啡续命,靠小红书下饭的普通人类。
176文章数 81关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

7人豪宅楼盘看房被困电梯呼叫铃还无反应 售楼部回应

头条要闻

7人豪宅楼盘看房被困电梯呼叫铃还无反应 售楼部回应

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

全新理想MEGA售50.98万 这一次“移动的家”更舒适更灵活

态度原创

教育
艺术
时尚
家居
军事航空

教育要闻

不要给孩子太多消费性快乐

艺术要闻

明代隐藏的“草书奇才”!水平不输张旭、怀素,当今知道他的人不足1%

白衬衫不火了?早秋穿“棕色衬衫”更高级好看

家居要闻

2026建博会(广州) 公装联探展交流活动

军事要闻

特朗普威胁伊朗终极打击蓄势待发

无障碍浏览 进入关怀版