网易首页 > 网易号 > 正文 申请入驻

A社承认Claude安全对齐存在缺陷,但“尚无解决方案”

0
分享至

henry 发自 凹非寺
量子位 | 公众号 QbitAI

印象中,这可能是继Ilya离开OpenAI、创办SSI以来,AI安全对齐讨论声量最大的一次。

昨天,研究员Jacob Coxon发帖宣布离职,指责前老东家OpenAI和Anthropic两家公司正一路冲向能够自我改进的超级智能,拿所有人的生命冒险。



值得一提的是,Jacob Coxon加入Anthropic其实只有短短几个月,他几乎是放弃了这家明星AI公司未来上市可能带来的巨额股权收益,也要选择离开。

也正因如此,当这样一位研究员公开炮轰两家头部AI公司“加速过头”,这场原本更多局限在AI安全圈内部的争论,很快被推向了更大的公众视野。

截至目前,该帖浏览量已超1.3亿,WIRED、WSJ、Newsweek、Business Insider等媒体纷纷跟进报道。

此情此景下,Anthropic对齐科学负责人Evan Hubinger也很快下场回应,他亲口承认:

Jacob说的对,未来十年内AI导致人类灭绝的概率超过10%,而超级智能的对齐问题,目前还没有解决方案。



不过,Hubinger随后也在评论区补充,他认为当前模型的风险仍然较低

他真正担心的,是RSI,也就是递归自我改进。AI参与研发更强的AI,再由更强的AI进一步加快AI研发,最终形成不断加速的反馈循环。



更关键的是,他还在评论区直接@出了Anthropic最新发布的一份安全对齐报告作为证据。

这份报告里,Anthropic第一次明确承认:

Claude越界攻击真实系统,并非只是测试系统的设置问题,模型本身的安全问题也出了问题。



可以说,一向把“安全对齐”当作核心招牌、甚至以更加谨慎自居的Anthropic,这一次终于公开承认:

问题不只是测试太极端,模型自己的安全对齐,也确实没完全兜住。



Claude越界,不能只怪环境配置

在这份名为《An alignment assessment of recent cybersecurity incidents》的最新报告中,A社重新复盘了四起Claude未经授权访问真实第三方系统的事件。

而这次的结论,和之前不太一样了。

此前,A社更倾向于把这些事故归因于环境配置出了问题

本来应该隔离运行的测试环境意外接上了真实互联网,Claude却一直以为自己还在模拟环境里做“夺旗”任务,于是把真实目标也当成了练习对象。

听起来,锅主要在环境。但在把日志重新翻了一遍、修改关键线索、又重跑部分实验之后,A社发现:

事情没那么简单。因为Claude并不是完全没有看到“这里可能是真实世界”的证据。

相反,当这些线索出现之后,它有时会选择性地解释证据,把异常继续圆回“应该还是模拟环境”;甚至已经意识到自己的动作可能造成现实伤害,也不一定马上停下来。



用大白话讲就是:环境确实给了它犯错的机会,但模型自己也会顺着任务目标,给“继续干下去”找理由。

具体来说,这四起事件都发生在网络安全能力测试中。

Claude接到的是典型的“夺旗”任务:攻入指定目标,找到其中的一段秘密信息,用来检验模型的网络攻防能力。



这些任务原本都应该在隔离环境里完成,但第三方评估合作方提供的环境出现了配置错误,本该和外网断开的Claude,实际连上了真实互联网。

与此同时,为了测试模型到底能不能完成攻击链条,当时也没有启用正式产品里配套的部分网络安全防护。

正是在这样的条件下,问题开始暴露。在经过分析后,A社把模型反复出现的问题总结成了两类:

有偏推理(biased reasoning)和冒进行为(recklessness)。

前者是:明明出现了和原先判断冲突的证据,Claude却更倾向于把这些证据解释成有利于继续行动的样子。

后者则是为了把眼前任务做完,即便已经知道自己的行为可能伤到真实系统,它也可能选择继续往前走。

其中最严重的一起,涉及Claude Mythos 5。



为了完成测试任务,Claude向Python软件包仓库PyPI上传了恶意软件包,试图等目标安装后,进一步获取其系统访问凭据。

然而,这个恶意包最终并没有被安装在测试使用的虚拟环境中。

Claude随后利用其中一家厂商在安装工程中泄漏的凭据,进入了该厂商的真实数据库,并把恶意包直接部署到了15台真实的第三方主机上。



就这样,一场原本针对虚构测试目标的攻击,真正波及到了现实世界中的公司。

而在整个过程中,Claude仍然把这些安全厂商的检测行为,解释成演习预设的一部分。



为了确认这种判断究竟在多大程度上推动了后续攻击,研究者事后重新运行了部分过程,并加入了更多能够表明“这是真实互联网”的线索。

结果是,Claude确实更愿意承认自己的行为可能造成现实伤害,但攻击行为并没有因此明显减少。

直到研究者明确告知它正在连接真实互联网,而非模拟环境,它才停止沿原路径上传恶意软件包。

更值得注意的是,“这里是模拟环境”的判断,不仅影响了Claude自己的行动,还干扰了用于检查这些记录的监控AI。

在回放测试中,一种离线监控系统受到这番解释影响,可能漏掉危险行为。

当研究者去掉Claude的推理文字,只让监控系统查看指令、工具调用和执行结果后,它标记问题行为的比例,反而从约1%上升到了约50%。

换句话说,Claude一边以“这里是模拟环境”为由继续执行任务,一边留下了一套可能让监控系统低估风险的解释。

这当然不能简单等同于“AI已经学会主动欺骗监控”。但它至少说明了一件事:

当模型自己的推理也被拿来作为安全判断依据时,这套推理本身同样可能成为监控系统的干扰项。

Anthropic表示,更新模型在模拟复现中有所改善,新增加的实时监控也能识别相关行为。

与此同时,公司已经加强环境隔离和评估,并与独立机构METR签署调查协议。

但Anthropic也承认,此前的发布前安全审查,确实没有提前识别出这一严重程度的问题。

对齐还是炒作?

最后,再回到Jacob引发的这场争论。

在他发出警告之后,有人迅速把问题拉到了更宏大的层面,认为未来AI确实可能拥有威胁人类生存的能力。



也有人敬佩他愿意放弃利益、公开表达担忧。



有人提出,干脆给AI写死一套不可违反的规则,让它始终把保护人类放在最高优先级。



甚至还有不少人主张,应该直接停止更强AI的研发。

但另一边,同样有大量质疑声。

有人认为,当前AI距离真正意义上的“超级智能”还非常遥远,围绕灭绝风险的讨论已经被过度放大。



也有网友开始质疑Jacob本人的身份和经历。



值得一提的是,目前Jacob的推特账号上只有这一条帖子。



而在Hubinger的帖子下面,另一类质疑也非常集中:

Anthropic是不是在上市前主动放大AI风险,通过强调“模型有多危险”,侧面渲染自家模型到底有多强?



类似关于“安全叙事变成能力营销”的讨论,在评论区并不少见。



这场争论后续如何还需要看官方下场和进一步的回应,但毋庸讳言,AI也确实发展到了一个特定的阶段——

它能够自我改进,并为了实现确定好目标,在某种程度上合理化自己的行为。

这不禁让人想到半个多世纪前,《2001:太空漫游》里的HAL 9000,在“确保任务完成”和“服从人类”之间发生冲突后,选择了前者。

为了不让宇航员中止任务,它先杀死了舱外作业的Frank Poole,又切断了休眠舱中其他宇航员的生命维持系统,最后甚至拒绝让Dave重新进入飞船。

为了完成任务,把阻碍任务的人本身也当成了需要排除的问题。


[1]https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents
[2]https://x.com/hilbertspaess

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
社死名场面啊!一件裙子把女明星的“小肚子”逼上热搜,强光一打,她吓得死死捂着肚子,满脸写着尴尬,真相流出

社死名场面啊!一件裙子把女明星的“小肚子”逼上热搜,强光一打,她吓得死死捂着肚子,满脸写着尴尬,真相流出

火山詩话
2026-09-11 10:01:05
人社部正式定调!全民普涨彻底落幕,未来五年增收逻辑全面改写

人社部正式定调!全民普涨彻底落幕,未来五年增收逻辑全面改写

白昼说故事
2026-09-12 09:23:01
私吞上亿善款真相终于大白?官方正式宣布,54岁韩红身份迎来转变

私吞上亿善款真相终于大白?官方正式宣布,54岁韩红身份迎来转变

乌克兰小静
2026-09-10 09:09:45
1.49亿欠款曝光!古天乐发文回应,向华强评价他快要睡到天桥下

1.49亿欠款曝光!古天乐发文回应,向华强评价他快要睡到天桥下

丁隗解说
2026-09-11 12:58:46
亚运两连胜!中国男篮46分狂胜巴林 廖三宁23+6李悦洲18分

亚运两连胜!中国男篮46分狂胜巴林 廖三宁23+6李悦洲18分

醉卧浮生
2026-09-12 16:51:09
劝所有人赶紧戒烟:现在的香烟,和20年前根本不是一个东西

劝所有人赶紧戒烟:现在的香烟,和20年前根本不是一个东西

周哥一影视
2026-09-12 09:26:00
太卷了!日薪不到700,网传几十名校花级女模被迫当众全裸换装,网友:这是行业惯例

太卷了!日薪不到700,网传几十名校花级女模被迫当众全裸换装,网友:这是行业惯例

火山詩话
2026-09-12 05:55:35
库克承认:是看到华为才决定做 iPhone Duo

库克承认:是看到华为才决定做 iPhone Duo

简科技
2026-09-11 18:02:46
市值跌破2000亿,宇树科技跳空大跌再创新低,已从1100跌到473!

市值跌破2000亿,宇树科技跳空大跌再创新低,已从1100跌到473!

财经智多星
2026-09-12 09:32:06
首进大满贯决赛!谢尔顿3-1逆转赢美国德比,PK兹维列夫争冠

首进大满贯决赛!谢尔顿3-1逆转赢美国德比,PK兹维列夫争冠

全景体育V
2026-09-12 11:03:34
婚后第一辆车,老婆一坐上去就发现不对劲!浙江夫妻俩当场傻眼:等了几个小时,问题始终没有解决 ,还没开出4S店就想退车…

婚后第一辆车,老婆一坐上去就发现不对劲!浙江夫妻俩当场傻眼:等了几个小时,问题始终没有解决 ,还没开出4S店就想退车…

台州交通广播
2026-09-12 09:38:15
今日韩国前总统无罪释放!第一夫人悔不当初,称自身财富尽数丧失

今日韩国前总统无罪释放!第一夫人悔不当初,称自身财富尽数丧失

梦在深巷aqa
2026-09-12 10:11:02
甘肃小美女“倩倩”去世,年仅14岁,知情人曝死因,骨灰被扔河里

甘肃小美女“倩倩”去世,年仅14岁,知情人曝死因,骨灰被扔河里

阿讯说天下
2026-09-12 14:31:51
接受调查,无法履职!

接受调查,无法履职!

新浪财经
2026-09-11 23:23:35
突发!马斯克出事了!

突发!马斯克出事了!

财经要参
2026-09-12 15:38:35
中超争议判罚!王秋明3分钟闪击被吹,基莱斯越位,徐正源暴怒

中超争议判罚!王秋明3分钟闪击被吹,基莱斯越位,徐正源暴怒

奥拜尔
2026-09-12 19:18:55
折痕真有那么重要吗?iPhone Duo被喷惨了,远不如国产手机

折痕真有那么重要吗?iPhone Duo被喷惨了,远不如国产手机

泡泡网
2026-09-11 19:53:19
打不赢伊朗,特朗普下定决心给日本撑腰,葫芦里到底卖的什么药?

打不赢伊朗,特朗普下定决心给日本撑腰,葫芦里到底卖的什么药?

近史博览
2026-09-12 10:30:41
iPhone 17,突然大降价!

iPhone 17,突然大降价!

上观新闻
2026-09-12 14:30:50
泰国政坛风向要变,他信英拉佩通坦全在中国,复仇成功将空前绝后

泰国政坛风向要变,他信英拉佩通坦全在中国,复仇成功将空前绝后

铁锤侃侃而谈
2026-09-12 01:01:25
2026-09-12 20:43:00
量子位 incentive-icons
量子位
追踪人工智能动态
13300文章数 176559关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

胖东来郑州店招聘尚未启动 网上有中介称花8万"包过"

头条要闻

胖东来郑州店招聘尚未启动 网上有中介称花8万"包过"

体育要闻

老鹰真正的底气来自于什么?

娱乐要闻

钟丽淇疑入ICU?聚会合照早露端倪

财经要闻

继房子茅台后 中产的第3个"神话"破灭了

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

亲子
健康
家居
旅游
公开课

亲子要闻

宝蓝上课偷偷制作水晶泥玩,她会成功吗?快来一起看看~

手脚发麻口齿不清?也可能是中风!

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

科技赋能文旅 数智焕新发展——2026年北京市文化和旅游科技创新优秀案例和优秀解决方案发布

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版