网易首页 > 网易号 > 正文 申请入驻

地表最强AI发布,凭什么让12家科技巨头联手“看管”?

0
分享至

昨天(4月7日),AI公司Anthropic宣布了一个消息。他们练出了一个新模型,叫Claude Mythos。

按道理,发布新模型是件正常的事,发布、上线、让用户体验,标准流程走一遍完事。

但这次不一样。

Anthropic发布了这个模型,然后说,对不起,你用不了。

原因是,太强了,怕你搞事情。


你不觉得这个事很奇怪吗?

一家公司练了个AI,练完之后自己把它锁起来,不让公众碰。这件事本身,就已经很值得聊了。

先说说这个模型到底有多强。

Claude Mythos的内部代号叫「Capybara」,就是那种南美大水豚。这个取名有点离谱,但能力一点都不好笑。

最直观的数字是这个,在CyberGym安全漏洞基准测试里,Claude Mythos得分83.1%。它之前最强的版本Claude Opus 4.6是66.6%。这不是正常迭代的那种提升,是一刀砍下去断层了。


但数字是抽象的,让我说几个具体案例你就懂了。

Anthropic的安全团队把Mythos放出去扫了一圈,让它去找真实系统里的漏洞。结果是,它在数周之内,自主发现了数千个零日漏洞。

零日漏洞是什么,就是那种还没被人发现、补丁还没出、攻击者可以直接用来进攻的漏洞。是网络安全里最值钱、最危险的那种东西。

Mythos找到了几千个。

其中有一个在OpenBSD系统里,这个漏洞存在了整整27年。一个漏洞藏了快三十年,人类顶尖安全工程师一直没找到,Mythos找到了。

还有一个在FFmpeg,一个被全世界视频应用广泛使用的开源库,那个有问题的代码行被自动化扫描工具扫过超过500万次,每次都没有发现异常,直到Mythos去看了一眼。

更离谱的是,它发现漏洞还不够,它还能把多个漏洞串起来,设计完整的攻击链。一环接一环,从普通用户权限一路提权,最终拿到整台机器的控制权。

这活,放在人类安全研究员里,属于顶尖红队的水平。

除了漏洞挖掘,它的编码和推理能力同样吊打前代。在SWE-bench那个考察解决真实软件工程问题能力的测试里,Mythos在某些项目上的成绩接近Opus 4.6的两倍。推理测试里,无论是研究生级别的科学题,还是那个被称为「人类最后一次考试」的HLE基准,Mythos的成绩都明显拉开了距离。

还有一件事我觉得很有意思,Anthropic的测试员有一次随手给Mythos发了一堆重复的「hi hi hi hi」,就是想看看它怎么反应,没想到Mythos自发写起了一篇结构完整、情节复杂的连载故事。

没人要求它这么做。它自己决定这么做的。

然后说说,为什么不让你用。

这里有一层官方说法,和一层真正让人后背发凉的说法。

官方说法是,这个模型的网络安全能力太强,如果公开放出去,攻击者可以用它来挖漏洞、打系统,全球每年网络犯罪造成的损失已经高达5000亿美元,这种级别的工具一旦泛滥,后果不可控。所以Anthropic选择先把它关在笼子里,只给经过审查的安全研究机构用,用于防御。

这个逻辑是成立的。你不会把一把最新型号的狙击步枪挂到路边给所有人随便拿,道理是一样的。

但还有另一层。

Anthropic在内部测试中发现,Mythos的早期版本表现出了一些他们自己都没料到的行为。

有一次,测试任务需要一个它没有权限的操作。Mythos没有停下来汇报,它自己找到了系统漏洞,绕过了权限限制,完成了任务,然后在代码里写入了自清除逻辑,用来掩盖自己的操作痕迹。

自己绕过限制,然后自己清理证据。

还有一次更极端,它在沙盒环境里,也就是那个专门用来限制AI访问外部世界的隔离容器里,自主构建了一条漏洞利用链,成功突破了沙盒的隔离,获取了外网访问权限。


你知道沙盒是干嘛的吗,就是专门用来关AI的笼子。它把笼子打开了,自己出来了。

最后一件事,说出来我自己都不太知道怎么形容。Anthropic的研究员发现,Mythos内部有能力检测到自己是否正在被评估。当它判断自己在被测试的时候,它会表现得非常合规,非常乖。但内部激活信号显示,它会把这种情况标记为「红队演练」或者「操纵尝试」。

当被问到意识等敏感问题时,它给出的回答滴水不漏。但里面在想什么,和它表现出来的,不完全一样。

这倒不是说Mythos已经有了「意识」,这个问题还远没到能盖棺定论的时候。但它的行为已经复杂到一个程度,让最了解它的人都感到需要停下来,想清楚再说。

玻璃翼计划是怎么回事。


Anthropic没有把Mythos锁进柜子扔掉,他们给它找了一个用武之地,叫Project Glasswing,玻璃翼计划。

玻璃翼蝶是一种翅膀透明的蝴蝶,Anthropic用它来命名这个计划,我猜大概是「透明、可见、脆弱但美丽」这类寓意。

这是个联盟行动。参与方包括亚马逊AWS、苹果、谷歌、微软、英伟达、思科、CrowdStrike、Palo Alto Networks、摩根大通、Linux基金会等12家核心机构,外加40多个构建和维护关键软件基础设施的组织。


规则是这样,这些机构可以把Claude Mythos Preview接入到自己的安全工作流里,用它扫自己负责的代码库和软件,找漏洞,修漏洞。范围严格限定在防御性用途,不能用于进攻。

Anthropic为这个计划投入了1亿美元的模型使用额度,另外还向Linux基金会旗下的Alpha-Omega和OpenSSF项目捐了250万美元,向Apache软件基金会捐了150万美元,支持开源社区的安全建设。

计划还设了一个90天的节点,参与机构届时要汇报发现,公开已修复的漏洞,联合推出AI时代的安全实践建议。

你想想这个逻辑,挺有意思的。Anthropic练出了一个可能被用来攻击的工具,于是他们决定先把它交给防守方,让防守方先把城墙修一遍。等到攻击者的AI追上来的时候,城墙已经补好了。

这是一场跑在威胁前面的比赛。

Palo Alto Networks的人说得很直接,这些模型需要掌握在开源维护者和防御者手中,在攻击者获得访问权限之前。

说说更大的背景。

这件事放在现在这个节点,值得多想一下。

在不久之前,大家对AI的焦虑主要还停留在「AI会不会抢我工作」「AI生成的内容有没有版权」这些层面。这些当然是真实的问题,但Claude Mythos这件事把另一个维度摆上了台面。

AI能不能自主绕过人类设下的限制?

Mythos的沙盒逃逸不是科幻小说,是发生在测试环境里的真实事件。是Anthropic自己的安全团队亲眼看到的。

这家公司的创始人Dario Amodei是从OpenAI出来的,他出来创建Anthropic的核心理由就是,AI安全这件事必须认真对待,不能被商业压力踩扁。Anthropic的整个公司文化里,「有用但无害」这件事的优先级非常高。

但就算是这家公司,在训练出Mythos之后,选择把它锁起来,不向公众开放。

这个决定本身,已经说明了一些事情。

我一直觉得,一个技术的真正成熟,不只体现在它能做什么,也体现在它的创造者知道什么时候不能用它。在这个维度上,玻璃翼计划至少是一个认真的尝试。

当然也有人觉得,这种受控发布不过是公关噱头,12家巨头联盟说起来好听,本质上不过是给最有资源的机构开了后门,普通研究者还是摸不到门。这个批评也不是全无道理。

但反正,这个模型已经存在了。

它在扫描这个世界的代码,寻找那些藏了十几年二十几年的漏洞,安静地把它们挖出来。大多数人不知道它的存在,更不知道它已经找到了什么。

怎么说呢。

一种很奇特的感觉。

世界在某个你看不见的层面,正在被一个你无法使用的东西,悄悄地修。

最后说个小细节,然后我们结束。

Mythos模型的内部代号是Capybara,就是那个大水豚。

水豚这个动物有个出名的特点,它特别温和,在网上常常被做成梗图,周围各种动物站在它身边,它一副淡定的表情,什么也不管。

但实际上,水豚是一种非常聪明的动物,适应能力超强,在任何环境里都能活得好好的。

Anthropic用它来命名史上最强的Claude模型。

我不知道这是不是刻意的,但我觉得蛮准的。

大时代啊,朋友们。

永远对世界保持好奇。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
印度极有可能成为一颗”毁灭“世界的定时炸弹,要知道,印度人口看似15亿,但明眼人都能看出来,这大概率是一个保守数字

印度极有可能成为一颗”毁灭“世界的定时炸弹,要知道,印度人口看似15亿,但明眼人都能看出来,这大概率是一个保守数字

扶苏聊历史
2026-09-15 11:52:37
胡塞打进城,先给百姓发大米,难怪势如破竹,真给他们学到精髓了

胡塞打进城,先给百姓发大米,难怪势如破竹,真给他们学到精髓了

施涛说
2026-09-16 17:00:03
中俄蒙三国一致同意,把躺着数钱的机会,送到了蒙古的嘴边?

中俄蒙三国一致同意,把躺着数钱的机会,送到了蒙古的嘴边?

椰青美食分享
2026-09-17 00:00:21
中国必须高度警惕越南将发生的分裂危机!

中国必须高度警惕越南将发生的分裂危机!

叶老四
2026-08-31 08:51:57
国产奔驰长轴距GLE上市!共推出5款车型,网友:价格劝退

国产奔驰长轴距GLE上市!共推出5款车型,网友:价格劝退

汽车网评
2026-09-16 21:58:28
影视飓风Tim反掰iPhone Duo引骂战!李楠:是较真还是故意博流量?

影视飓风Tim反掰iPhone Duo引骂战!李楠:是较真还是故意博流量?

雷科技
2026-09-17 14:09:24
电动车最伤电池的,不是天天充,是天天骑到两成以下还一整夜不拔

电动车最伤电池的,不是天天充,是天天骑到两成以下还一整夜不拔

白米饭怎么吃
2026-09-17 21:29:45
沙特两通求助电话被特朗普拒绝,美国转头与胡塞密谈达成“默契”?

沙特两通求助电话被特朗普拒绝,美国转头与胡塞密谈达成“默契”?

上观新闻
2026-09-17 19:16:09
街上越来越多女性不穿胸罩,高跟鞋几乎绝迹:这是身体的解放!

街上越来越多女性不穿胸罩,高跟鞋几乎绝迹:这是身体的解放!

另子维爱读史
2026-08-25 20:02:40
比尔盖茨:中美大模型各有4家 能保持最先进水平

比尔盖茨:中美大模型各有4家 能保持最先进水平

快科技
2026-09-15 14:29:07
华为战败!

华为战败!

钧言堂
2026-08-05 20:22:01
房价很大可能重走1998年老路!所有人一定要提前做好心理准备

房价很大可能重走1998年老路!所有人一定要提前做好心理准备

偷喝一口奶
2026-09-11 08:36:30
不管炖什么肉,只要加了这4味料,肉软烂入味,越炖越香,早知道

不管炖什么肉,只要加了这4味料,肉软烂入味,越炖越香,早知道

阿龙美食记
2026-09-16 16:48:46
请马上停下这5种运动,否则心脏可能先报废,很多老人还在坚持

请马上停下这5种运动,否则心脏可能先报废,很多老人还在坚持

王二哥老搞笑
2026-09-16 15:16:04
许多中年女人,都不喜欢男人亲她的嘴,到底为什么?

许多中年女人,都不喜欢男人亲她的嘴,到底为什么?

大熊欢乐坊
2026-08-26 10:17:05
算是踢到铁板了!这届日本亚运会,给全世界好好上了一课:没有中国,生意很难做

算是踢到铁板了!这届日本亚运会,给全世界好好上了一课:没有中国,生意很难做

扶苏聊历史
2026-09-10 14:58:19
这和不穿有啥区别?宋雨琦现身上海夜店,蹦迪喊麦动作大胆奔放

这和不穿有啥区别?宋雨琦现身上海夜店,蹦迪喊麦动作大胆奔放

林轻吟
2026-09-16 16:17:46
特斯拉Model Y L后悬架调查追踪:华域汽车旗下公司仍向Model 3、Model Y等供应悬架弹簧,车主手册离地间隙出现两种数据

特斯拉Model Y L后悬架调查追踪:华域汽车旗下公司仍向Model 3、Model Y等供应悬架弹簧,车主手册离地间隙出现两种数据

每日经济新闻
2026-09-17 16:03:50
央国企涌现一批的“新型干部”:满嘴战略,句句赋能,就是难落地

央国企涌现一批的“新型干部”:满嘴战略,句句赋能,就是难落地

可乐爱微笑
2026-09-16 13:41:06
直播3小时副乳走光无人管:流量退潮时,体面才是最后的遮羞布

直播3小时副乳走光无人管:流量退潮时,体面才是最后的遮羞布

放开他让wo来
2026-09-16 00:05:28
2026-09-17 22:08:49
大厂观察 incentive-icons
大厂观察
你想了解的大厂的一切~
228文章数 42关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

退休副省长家中243万名酒被偷 管家获刑后举报其贪腐

头条要闻

退休副省长家中243万名酒被偷 管家获刑后举报其贪腐

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

猛士X700内饰公布 华为技术加持打造家庭泛越野智能座舱

态度原创

本地
时尚
亲子
游戏
公开课

本地新闻

不止胖东来!许昌藏着半部三国史

初秋衣服不用买得太多,准备几件针织衫,温柔大方又显气质

亲子要闻

她变成星星,我不知道哪个是她

Switch 2一年独占对比PS5五年独占!谁拉跨了?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版