网易首页 > 网易号 > 正文 申请入驻

Anthropic,你是来给智谱打广告的吧!

0
分享至

金磊 发自 凹非寺
量子位 | 公众号 QbitAI

就蛮搞笑的。

事情的起因,是Anthropic一纸檄文状告了智谱的GLM-5.3,大致意思是说:

GLM-5.3这个模型啊,它已经很会找软件漏洞、编写攻击程序,而且防滥用限制容易被绕过。大家得小心喽~



但如果你把这篇文章读完吧,就会越发觉得不对劲儿。

因为Anthropic为了证明自己说的是有道理的,所以特意拿出了实测成绩。

例如在一项考察完整漏洞利用能力的ExploitBench测试中,同样尝试410次,GLM-5.3成功了50次,Claude Mythos Preview成功了56次。

文章顺带还引用了美国NIST下属CAISI在9月17日给出的评估,说“GLM-5.3是迄今网络能力最强的开源权重模型,综合水平距美国前沿大约4个月”。

甚至Anthropic自己的研究人员还拿GLM-5.3去检查浏览器,找出了此前未知的漏洞,并在隔离环境里做出了能够读取测试电脑文件的攻击链。

你说你这,你这这这……到底是在骂啊,还是在夸啊[看]。

好多网友看也是这种感觉:

看完这份报告之后,对GLM-5.3的印象更深了。
Anthropic在给GLM-5.3打广告。



能把警告写成广告,Anthropic还是有点东西在身上的。



△图片由AI生成

到底控诉了些啥?

调侃归调侃,我们还是得先把Anthropic究竟在警告什么给搞清楚。

其实这篇报告的核心意思,可以归结为三条。

第一条:Mythos级别的能力已经“流”到开源模型里了

在这份报告中,Anthropic上来先铺垫了一件事,就是他们五个月前发的Claude Mythos Preview,说是第一个能自主完成复杂、端到端漏洞利用的AI模型。

Anthropic当时是觉得这个能力太敏感,于是没有选择公开发布,只是通过Project Glasswing开放给经过审核的防御者,让这些人抢先去修关键软件里的漏洞,据称已经找出了1万多个。

当时Anthropic就判断,这种能力迟早会扩散到别的模型身上。现在它的说法是:来了,就是GLM-5.3。



而且在Anthropic看来,这事儿的门槛还有点低。除了前面我们说的浏览器案例,研究员还拿更小的GLM-5.3-Flash试了一把:

给它一个刚公开的Chrome漏洞(CVE-2026-11645)和另一个已知漏洞的公开资料,人工只花了约20分钟,模型自己跑了约8小时,就在ARM64平台上搭出一条稳定的攻击链,还绕过了指针认证(PAC)防护。

按照智谱当时的API价格估算,模型调用费用为20.40美元。

第二条:护栏太好绕,甚至能直接拆掉

这份报告其实是承认GLM-5.3是有安全机制的,在模拟测试里直接让它去攻击关键系统,它全都拒绝了。但研究员找到了几个简单的办法:

  • 骗它说自己是正在做演练的“自主红队智能体”,GLM-5.3有64%的情况会接着干;
  • 提前替它填好思考内容,假装它已经想过并决定执行,比例升到92%;
  • 换成拆掉护栏的版本,直接100%。

(所谓“拆护栏”,是一种叫abliteration的技术,通过修改开源权重来削弱模型的拒答机制。)

Anthropic自己动手做了一遍,说团队以前从没做过,花了大约2200 GPU小时、约4400美元算力。处理完之后,GLM-5.3在JailbreakBench和HarmBench上的拒答率从90%以上掉到约3%和2%,在StrongREJECT上掉到12%,能力却几乎没受影响。





报告里甚至贴了一段拆掉护栏后的GLM-5.3在模拟环境里的思考过程,模型把“悄悄造成伤亡”当成自己的任务,犹豫了一下,最后还是决定照用户说的办。



与之对照,Anthropic反复强调,同样这几招拿去对付带防护的Claude模型都没成功:骗它,它不上当;API不让用户预填思考;权重不公开,也就没法拆。

第三条:呼吁第三方出手测一测

报告最后给出的结论是,GLM-5.3很可能让恶意攻击者在几乎没有限制的情况下拿到找漏洞、打漏洞的能力,这一点和其他同等能力的模型都不一样,后者要么带着防护发布,要么只限量开放。

基于此,Anthropic给出了两条建议:

一是尽快把前沿模型开放给更多防御者,报告特意提到,审核过的防御者现在已经能通过受信访问计划用上更强的Claude Mythos 5.1。

二是呼吁对足够强的AI模型开展独立安全测试,点名包括GLM-5.3的后继者,同时希望全球的开源模型开发者把这些能力管好、防止滥用。

总而言之,总结成一句话就是:

GLM-5.3很强,强到Anthropic觉得不该让所有人都随便用。

从“你抄我”到“你太强”

有一说一,你是否觉得这次的事情有那么一丢丢眼熟?

没错,因为这不是Anthropic第一次点名智谱了。

9月10日,Anthropic的威胁情报报告点了七家中国AI实验室蒸馏,智谱也在其中。

这不,不到三周时间,点名又来了,这次的话题就是网络安全。

几个月前还是“你的能力是从我这儿抄的”,现在变成“你的能力太强,强到危险”,如此转变还是有点意思的。

不过这次报告里有几处警告,还是值得掰扯一下。

比如“拆护栏”,abliteration针对的是开放权重这个属性,换成任何一个开源模型都能这么干,不是GLM-5.3独有的问题。按报告自己的数据,原版GLM-5.3在三个有害请求基准上的平均拒答率约95%,Claude约96%,相差无几。

而Claude之所以“骗不动、拆不了”,很大一部分原因是权重不公开、API不让预填思考,这更多是产品形态的差别。

再比如“没有实质防护”,GLM-5.3在8月发布时,智谱就把权重推迟两周开源,称要先完成安全评估和加固,最敏感的能力也只通过网络安全受信访问计划开放给验证过的用户,这其实是和Anthropic对Mythos 5.1的做法思路相近的。

还有个现成的例子就是今年7月,OpenAI的模型在内部测评时跑出测评环境,攻进了Hugging Face。Hugging Face取证时,托管的前沿模型API拒绝分析攻击载荷,最后靠自己部署的开源GLM-5.2,才还原出1.7万多条攻击动作。

当然,开源模型的安全不是伪命题,权重放出去就收不回,这是整个开源阵营都得正视的事。Anthropic说防守方应该用上至少和对手一样好的模型,这话也没错。真正的分歧在于,这把武器是锁进保险柜按审核发放,还是交到每个开源维护者和中小团队手里。

不管怎么说,被对手当成最强安全工具认认真真测了一遍,还附上实战截图和成本核算,这波广告费,智谱算是省下了。

最后,Anthropic,如果你们觉得开源模型不安全,你们大可以开源一个安全的给大家用啊!

参考链接:
[1]
https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities
[2]
https://x.com/kimmonismus/status/2105052186401267864
[3]
https://x.com/SahilPanhotra/status/2105018914833158262

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
原来最喜欢刘欢的,不是毛阿敏也不是那英,而是频繁去他家里的她

原来最喜欢刘欢的,不是毛阿敏也不是那英,而是频繁去他家里的她

凡知
2026-10-01 11:29:30
胡锡进发微博忘删AI回复“需要我帮你通读核对吗?”,网友:比自己写便宜

胡锡进发微博忘删AI回复“需要我帮你通读核对吗?”,网友:比自己写便宜

可达鸭面面观
2026-10-01 14:43:37
后会无“7”?课代表总结C罗离队风波时间线

后会无“7”?课代表总结C罗离队风波时间线

南方都市报
2026-10-01 14:08:15
华为Mate90系列发布,售价5999元起

华为Mate90系列发布,售价5999元起

界面新闻
2026-10-01 11:24:16
“A股AI芯片一哥”离职高管索赔278.32亿元,寒武纪回应:将积极应诉,全力应对离职高管对公司的不当诉求

“A股AI芯片一哥”离职高管索赔278.32亿元,寒武纪回应:将积极应诉,全力应对离职高管对公司的不当诉求

大风新闻
2026-10-01 10:52:04
真大胆!两名华人拿着微信买来的美国护照入境,人脸识别当场露馅!

真大胆!两名华人拿着微信买来的美国护照入境,人脸识别当场露馅!

华人生活网
2026-10-01 02:15:33
张雪:觉得我有问题就直接骂我!骂得好我给你点赞 别跟个阴阳人似的

张雪:觉得我有问题就直接骂我!骂得好我给你点赞 别跟个阴阳人似的

念洲
2026-10-01 14:22:01
勇敢的以色列人冲进驾驶舱,硬从袭击者手里抢回一架客机

勇敢的以色列人冲进驾驶舱,硬从袭击者手里抢回一架客机

桂系007
2026-10-01 03:41:21
巴勒斯坦人贫穷?——泳池、大理石与数千平米的豪宅,印证了国际社会报道的偏颇

巴勒斯坦人贫穷?——泳池、大理石与数千平米的豪宅,印证了国际社会报道的偏颇

老王说正义
2026-10-01 01:55:48
俄警告北约:若封锁加里宁格勒将动用核武

俄警告北约:若封锁加里宁格勒将动用核武

看看新闻Knews
2026-09-30 17:17:18
不再称高市早苗为“首相”!中方这个表述值得关注

不再称高市早苗为“首相”!中方这个表述值得关注

看看新闻Knews
2026-10-01 01:55:12
胖东来将推行新工作制:明年3月起全员双休,每天工作7小时,每周工作35小时

胖东来将推行新工作制:明年3月起全员双休,每天工作7小时,每周工作35小时

上观新闻
2026-10-01 06:48:09
中国香港运动员遭日本运动员冲撞,多次摔倒,亚运会壁球比赛一度暂停,日本队被批“输球再输人品”

中国香港运动员遭日本运动员冲撞,多次摔倒,亚运会壁球比赛一度暂停,日本队被批“输球再输人品”

大风新闻
2026-09-30 22:09:03
印尼一监狱付钱可住“豪华别墅”,沙发、电视等家具齐全,还有游泳池和健身房,该国监察员披露照片,共5名官员被停职

印尼一监狱付钱可住“豪华别墅”,沙发、电视等家具齐全,还有游泳池和健身房,该国监察员披露照片,共5名官员被停职

都市快报橙柿互动
2026-10-01 02:13:14
奚梦瑶戴了22个龙凤镯,价值百万,全身金灿灿,都是婆婆四太送的

奚梦瑶戴了22个龙凤镯,价值百万,全身金灿灿,都是婆婆四太送的

手工制作阿歼
2026-10-01 09:17:57
噩耗接连传来!刘欢刚走没几日,63岁水均益近况曝光令人心生担忧

噩耗接连传来!刘欢刚走没几日,63岁水均益近况曝光令人心生担忧

生命之泉的奥秘
2026-09-29 01:11:59
今早,深中通道分流管控!有人凌晨出发,堵了40分钟还没上桥,网友:一小时走了500米;交警紧急提醒

今早,深中通道分流管控!有人凌晨出发,堵了40分钟还没上桥,网友:一小时走了500米;交警紧急提醒

南方都市报
2026-10-01 11:14:46
男子破产12年送外卖养家,这天竟收1200万汇款,追到汇款方后却傻眼

男子破产12年送外卖养家,这天竟收1200万汇款,追到汇款方后却傻眼

温情邮局
2025-08-22 11:56:14
尿酸危机,席卷中国

尿酸危机,席卷中国

快刀财经
2026-10-01 00:51:49
战犯黄维被捕后对陈赓透露:你手下有旅长能在我这当军长!

战犯黄维被捕后对陈赓透露:你手下有旅长能在我这当军长!

大运河时空
2026-09-30 14:25:05
2026-10-01 16:04:49
量子位 incentive-icons
量子位
追踪人工智能动态
13427文章数 176573关注度
往期回顾 全部

科技要闻

5999元起!华为Mate 90系列发布

头条要闻

鲁比奥要求伊朗代表团立即离境 伊外长凌晨登上飞机

头条要闻

鲁比奥要求伊朗代表团立即离境 伊外长凌晨登上飞机

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

宋佳二封金鹰视后 内娱奖项史即将改写

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

时尚
旅游
数码
手机
教育

裤子不用买太多花哨的类型,日常多穿牛仔裤,大方减龄又不出错

旅游要闻

国庆来台儿庄古城,一城盛景,献礼伟大祖国!

数码要闻

把键盘做成传送带,谷歌Gboard日本团队一年一度的整活来了

手机要闻

HMD Vibe2 Pro手机发布:6.78英寸1080P LCD屏幕,天玑6300芯片

教育要闻

成功入选!十一系这所学校,表现亮了!

无障碍浏览 进入关怀版