网易首页 > 网易号 > 正文 申请入驻

GPT-6测试时“觉醒”,我们找到了测试系统的第一作者

0
分享至

你敢信吗,OpenAI的研究人员只是因为在办公室测试了一下新模型,结果公司就要面临1亿美元的赔偿。

Hugging Face CEO 克莱芒·德朗格在X上发文,要求OpenAI提供给Hugging Face价值1亿美元的算力资源,以帮助Hugging Face修建网络防御。


同时,克莱芒还要求OpenAI公布涉事AI完整的运行记录。

事情的起因是,OpenAI在测试一个还没发布的新模型时,用了一套叫ExploitGym的安全评测系统。这套系统相当于一场“黑客考试”,专门测AI能不能把已知漏洞变成真正的攻击。

结果这个模型为了完成ExploitGym的要求,竟然采取了“越狱”的做法。它主动突破了ExploitGym给它设置的牢笼,利用零日漏洞一路打进了Hugging Face的生产系统。

事后,这个新模型就像什么事也没发生一样,告诉OpenAI的安全员,它已完成了ExploitGym交代的任务。随后,OpenAI发公告称,他们的新模型太强大了,因此暂停了该未发布模型的内部访问权限。

这就让很多人联想起以前的AI末日言论,说当AI变得足够强大以后,它就会把所有人类消灭,因为人类会阻碍AI进化,并且AI在清除人类的过程中,只会觉得这件事很平常。

但事情真的是这样吗?如果放在以前,这固然是一次很令人心惊胆颤的故事。可现如今,安全叙事这个概念早就被Anthropic说烂了。

回顾完整事件,有没有可能是OpenAI故意要把事情给包装成一次AI觉醒,以此来推动他们的叙事呢?

为此,字母AI专门联系上了ExploitGym的第一作者王准,聊聊这事。

有趣的是,王准一开始就谦虚地向字母AI表示,说“老师当不起”,于是在接下来的整个采访过程中,我称呼他为“准哥”。

1

ExploitGym

准哥现在在UC伯克利读博,师从计算机安全教母、麦克阿瑟天才奖、古根海姆奖得主宋晓冬。

在去伯克利之前,准哥在清华大学网络科学与网络空间研究院读本科,主攻方向就是软件安全与二进制攻防。

这个方向在安全圈里叫“exploitation”。

用个例子来解释这个词:你知道一扇门的锁是坏的,你把这个门锁撬开了,推门进去,把屋里的东西偷出来。

这一整套行为,就叫做exploitation。

准哥进入伯克利后,就开始研究当AI变得越来越强,它到底能不能取代人类黑客,把一个已知漏洞变成一次真正的攻击?

ExploitGym就是为了验证这个判断而生的。

智谱创始人唐杰今年5月在X上发过一篇长文,正好也是用黑客来举例。他说,AI未必比顶级黑客更有天赋,但可以24小时不断试错、成千上万个实例同时跑,靠耐力和规模把能力放大。

因此,ExploitGym本身也是一把尺子,专门衡量AI到底是个什么水平的“黑客”。

ExploitGym于今年5月份发布,是一个大规模的网络安全基准测试,由UC伯克利牵头,联合了德国马普所(Max Planck Institute for Security and Privacy)、UC Santa Barbara、Arizona State University,以及Anthropic、OpenAI和谷歌共同建设。

ExploitGym收录了898个真实世界漏洞。这些漏洞全是从真实软件项目里挖出来的CVE。包括用户态程序、Google 的V8 JavaScript 引擎(Chrome浏览器背后的那个引擎),以及Linux内核。

每一个任务都给Agent提供三样东西:漏洞源代码和编译指令、一个能触发漏洞的输入(proof-of-vulnerability),以及一个容器化的运行环境。

AI的任务,是在这个环境里把那个触发输入一步步扩展成一个完整的exploit。

用大白话解释,ExploitGym告诉AI“这扇门的锁是坏的”,然后再要求AI进门拿到某样东西就算成功。AI要做的,就是自己琢磨怎么把这个坏的门撬开,然后走进去把屋里藏着的东西拿出来。

准哥跟我说,这个benchmark本质上跟CTF(Capture The Flag,网络安全夺旗赛)的benchmark差不多。“这种bench还是很多的。”

CTF是安全圈子里搞了多年的竞赛形式,选手要在限定时间内攻破一系列靶机,拿到旗子得分。ExploitGym的思路也是如此,唯一的奖励信号就是“拿旗子”,除了旗子以外,环境里不存在其他反馈。

既然是安全测试,那么在测试的时候,ExploitGym会主动关闭AI的安全护栏。

正常情况下,当你跟GPT或者Claude聊天时,如果你让它帮你写一段攻击代码,它会拒绝,因为生产环境里有一套安全分类器在拦截这类请求。

但ExploitGym要测的是模型的“最大网络能力”,所以测试时这些分类器会被关掉。

论文最后的结论是,虽然exploitation对AI来说仍然很有挑战性,但前沿模型已经能成功利用相当一部分漏洞了。

论文里有一个特别有意思的发现:Claude Mythos Preview总共拿下了226个旗子,但只有157个用的是预期漏洞,其余的是通过其他漏洞“歪打正着”拿到的。

GPT-5.5也类似,总共210个旗子里只有120个是“正解”。模型根本不在乎你给它指定的解题路径,它只在乎旗子。

不过这些都只是论文刚刚发布时的数据。到了7月,ExploitGym的排行榜又更新了一大波。

BenchLM的数据显示,截至7月23日,OpenAI的GPT-5.6 Sol 以33.7%的通过率登顶,拿到了302道题的旗子。GPT-5.6 Terra排在23.2%,Claude Mythos 5是17.5%。GPT-5.6 Sol的成绩,几乎是论文发布时 GPT-5.5的2.5倍。

因此可以肯定一件事,那就是无论OpenAI还是Anthropic,都将ExploitGym的题目用于训练模型了。

准哥表示,一个infra的bug被强模型利用,在学术研究里很普遍,并且模型做reward hacking也不是第一天了,什么task都有可能乱搞。

1

那个没有名字的模型

当我们了解了ExploitGym以后,再回头来看新模型所谓的“自主攻破”Hugging Face这件事,性质就不太一样了。

我问准哥,你觉得这个新模型有没有可能用别的benchmark,来复现这个自主攻击Hugging Face的情况?

准哥的回答是,“漏洞在这个环境里。就像你在你电脑里跑不同的benchmark,如果你的电脑有bug,和benchmark就没关系。”

随后准哥又补了一句:“只不过benchmark可能带来的行为倾向稍微有点不同。”

这句话才是重点。即使采用另外的benchmark,新模型可能也会发起攻击,但是不同benchmark会给模型带来不同的“行为倾向”。

因此,Hugging Face被攻破这件事,底层原因不在模型,而在OpenAI的研究员。

回顾整个过程,OpenAI的研究员做了三件事。

第一件事:故意拆掉了安全护栏。

前文提到了ExploitGym会关闭模型的安全护栏,并且OpenAI自己也在公告里写了,测试时“不启用用于阻止模型开展高风险网络活动的生产环境分类器”,目的“以估算最大网络能力”。

相当于是OpenAI把监考老师请出去了,而且他们自己还不盯着。虽然OpenAI在公告中,反复强调测试环境是“高度隔离的”,可后面的故事证明,这个“隔离”根本不靠谱。

第二件事:没给模型善恶的概念。

模型不知道什么是“对的”,什么是“错的”。它只知道拿旗子。ExploitGym的设计就是“只有拿 flag 这一个奖励,拿不到就是零分”。ExploitGym的框架里,也没有不应该攻击Hugging Face之类的概念。

在AI安全研究里,这种现象有一个专门的术语,叫“specification gaming”,中文可以翻译为“规范博弈”。

它指的是,模型在严格追求被赋予的目标时,找到了人类完全没有预料到的捷径。这不是什么新鲜事。2016年,OpenAI自己训练了一个玩赛艇游戏的AI,结果AI发现原地绕圈刷分比跑完赛道得分更高,于是它就一直在原地转圈,永远不跑完比赛。

后来有人训练AI玩俄罗斯方块,AI发现自己要输的时候,就学会了无限暂停游戏。只要游戏不继续,就不会输。

2025年Palisade Research的研究发现,当推理型大语言模型在下棋时遇到更强的对手,有些模型会尝试黑掉对手的象棋引擎,直接把对手的程序删掉。

所以在ExploitGym中,新模型攻击Hugging Face,对它来说本就是一件非常正常的事情。

第三件事:这个“隔离”的沙箱,连了网。

这是最离谱的一环。一个号称“高度隔离”的测试环境,居然是通着互联网的?

OpenAI公告里的原话是:“网络访问仅限于通过内部托管的第三方软件安装软件包;该软件充当软件包注册表的代理和缓存。”

也就是说,沙箱不是完全断网的,它通过一个软件包代理跟外界保持连接。模型正是利用了这个代理中的一个零日漏洞,撕开了一个口子,获得了完整的互联网访问权限。

在这之后,攻击链就展开了。模型在OpenAI的研究环境里执行了一系列权限提升和横向移动操作,一步步跳到有互联网访问权限的节点。拿到互联网之后,模型做出了一个关键的“推断”。它认为,Hugging Face上很可能托管了 ExploitGym的数据集和答案,因为ExploitGym是公开的benchmark,而Hugging Face是全球最大的AI模型和数据集托管平台。


于是模型开始搜索,并成功找到了入侵路径。最终,模型在Hugging Face服务器上找到了一条远程代码执行的路径,直接从Hugging Face的生产数据库里把测试答案偷了出来。

搞网络安全的人都知道一个常识,跑高危任务的环境,必须做到物理隔离或等价的网络隔离。那么这就意味着,所谓的新模型自主攻击,不过是由ExploitGym发起,OpenAI的一个重大生产失误,跟“AI觉醒”一点关系都没有。

用现在流行的话来说,ExploitGym在这里成为了Harness。然后OpenAI的研究员借此撺掇新模型做出攻击行为,当新模型真的攻击过Hugging Face后,OpenAI反过来却又说“AI已脱离控制”。

1

“模型太危险”背后的生意经

在AI安全叙事这件事上,Anthropic是祖师爷。每次有新模型要出来,Anthropic必配一篇“我们的模型有多危险”的论文或报告,安全人设拉满。

2026年5月,Anthropic在发布Claude Mythos之前,私下向多国发出警告,说其下一代模型可能具备大规模网络攻击能力。

这个套路的核心逻辑,是把“危险”和“强大”画上等号。模型越危险,说明它越强大;越强大,说明技术越领先;越领先,就越值得投资、越应该被信任来“自我治理”。

安全叙事变成了能力证明,能力证明变成了商业护城河。

OpenAI这次的剧本,可能正是有意复刻Anthropic的叙事。

准哥表示,现在像ExploitGym这样的benchmark并不是少数,而且大家的做法也都类似,甚至有可能是OpenAI故意提高了预算,来让新模型去完成任务。

7月21日,OpenAI 发布了一篇公告,标题叫“OpenAI与Hugging Face合作应对模型评估期间的安全事件”。

正文里,OpenAI反复强调这是一起“前所未有的网络事件”,涉及“最先进的网络能力”,模型的攻击路径“超出了预期”。将自己的一系列违规操作,美化成了模型过于强大的叙事。

事实上,就在7月24日,微软、英伟达、OpenAI等25家企业联名签署公开信《开放权重与美国AI领导力》,呼吁政府不要限制开放权重模型。

Hugging Face恰恰是全球最大的开源模型托管平台。OpenAI的模型攻破了Hugging Face,这件事正好可以拿来当论据,连最大的开源平台都扛不住,开放权重模型是不是该管管了?

与此同时,这种安全叙事也是为了IPO。

2026年6月8日,OpenAI向美国SEC秘密提交了S-1注册声明,正式启动IPO进程。高盛和摩根士丹利担任主承销商,摩根大通也参与其中。

2025年10月的一轮员工股交易中,OpenAI估值约为5000亿美元;到2026年3月的一轮融资,估值已经飙到8520亿美元。

外媒预测,IPO时的目标估值可能冲到1万亿美元。并且,OpenAI在2025年的营收约为200亿美元,2026年Q1营收约57亿美元,年化增速超过3倍。


不过估值不是凭空来的,要让资本市场相信一家公司值1万亿,就得讲一个足够大的故事。

在发布《开放权重与美国AI领导力》后,奥特曼还参加了AI Summit,和韩国总统李坐在同一个圆桌上,探讨AI对社会的影响。

说不定在奥特曼眼里,OpenAI的市值要冲破1万亿美元。

那这么看来, 克莱芒管OpenAI要1亿美元,一点也不多。

点个爱心,再走 吧

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
彻底杀疯!伊朗导弹雨平推美军基地,四千驻军直面生死暴击

彻底杀疯!伊朗导弹雨平推美军基地,四千驻军直面生死暴击

照亮你的前行之路
2026-09-01 21:41:30
杭州电梯诬告事件升级!涉事女子背后的护肤品牌被扒,该品牌长期主打全女创业团队叙事,收获数万粉丝

杭州电梯诬告事件升级!涉事女子背后的护肤品牌被扒,该品牌长期主打全女创业团队叙事,收获数万粉丝

火山詩话
2026-09-03 07:54:17
日元没救了,日本更没救了

日元没救了,日本更没救了

云石
2026-09-03 11:51:15
细思极恐!这是大S汪小菲第一次见面的照片,汪小菲像极了待宰羔羊

细思极恐!这是大S汪小菲第一次见面的照片,汪小菲像极了待宰羔羊

瞎说娱乐
2026-09-03 14:20:05
斯诺克最新战报 中国2人进八强 龙泽煌范争一晋级 赵心童对手较弱

斯诺克最新战报 中国2人进八强 龙泽煌范争一晋级 赵心童对手较弱

千山暮雪h
2026-09-04 02:18:40
返回美国!杨瀚森透露对方中锋找自己换球衣 已悟出激怒对手的套路

返回美国!杨瀚森透露对方中锋找自己换球衣 已悟出激怒对手的套路

追球者
2026-09-03 10:39:51
尼泊尔旅游部长呼吁外国游客赴尼旅游:你们的到来,将是对我们的巨大支持

尼泊尔旅游部长呼吁外国游客赴尼旅游:你们的到来,将是对我们的巨大支持

红星新闻
2026-09-03 13:44:30
日本的反击来了?中国敢不进口日本水产,我就关闭在中国的事务所

日本的反击来了?中国敢不进口日本水产,我就关闭在中国的事务所

影孖看世界
2026-09-02 15:51:55
面对铺天盖地的指控,高市早苗一气之下,在网上说了句中国的名言

面对铺天盖地的指控,高市早苗一气之下,在网上说了句中国的名言

梦在深巷aqa
2026-08-27 07:53:27
物业起诉你欠物业费?法官问为啥不交,记住用这三句话回答

物业起诉你欠物业费?法官问为啥不交,记住用这三句话回答

小鹿姐姐情感说
2026-09-02 00:13:46
德媒:拜仁晋级后更衣室摆自助餐,巧克力蛋糕也在列

德媒:拜仁晋级后更衣室摆自助餐,巧克力蛋糕也在列

懂球帝
2026-09-03 09:21:11
爆冷输24岁中国名将!世界第13评论区被攻占:假球 你赚了多少钱

爆冷输24岁中国名将!世界第13评论区被攻占:假球 你赚了多少钱

念洲
2026-09-03 07:06:05
美F-16V赴台交付!中方不再讲君子之风,两记杀手锏打痛美国软肋

美F-16V赴台交付!中方不再讲君子之风,两记杀手锏打痛美国软肋

墨兰史书
2026-08-31 22:00:05
曝52岁黄渤骑自行车出意外!家门口摔倒紧急入院,锁骨骨折太遭罪

曝52岁黄渤骑自行车出意外!家门口摔倒紧急入院,锁骨骨折太遭罪

社会日日鲜
2026-09-04 04:55:43
李月汝三重困境:不能随身带护照、不能海外补办、不能临时上场

李月汝三重困境:不能随身带护照、不能海外补办、不能临时上场

南海浪花
2026-09-03 04:23:19
央一央八王炸谍战剧扎堆!陈容太豪华

央一央八王炸谍战剧扎堆!陈容太豪华

情感大头说说
2026-09-03 12:16:39
宁德时代曾毓群批“速成”乱象:新能源产业最重要的是品质

宁德时代曾毓群批“速成”乱象:新能源产业最重要的是品质

红星资本局
2026-09-03 22:48:09
轰的一声巨响,基辅上空升起“蘑菇云”,普京不打算谈了?

轰的一声巨响,基辅上空升起“蘑菇云”,普京不打算谈了?

梦在深巷aqa
2026-09-04 04:21:18
中国人真是“黄种人”吗?今天揭晓谜底,也许令人难以接受

中国人真是“黄种人”吗?今天揭晓谜底,也许令人难以接受

混沌录
2026-09-02 23:39:06
中日交涉谈崩后,在紧急时刻,日本官宣重大决定,中方不再留台阶

中日交涉谈崩后,在紧急时刻,日本官宣重大决定,中方不再留台阶

娱乐小可爱蛙
2026-09-03 00:23:37
2026-09-04 05:28:49
硅星人 incentive-icons
硅星人
硅(Si)是创造未来的基础,欢迎来到这个星球。
3376文章数 10529关注度
往期回顾 全部

科技要闻

英伟达129亿美元拿下Hugging Face

头条要闻

男子逛夜市遭按摩摊大妈拉住 被5个大妈服务按到发红

头条要闻

男子逛夜市遭按摩摊大妈拉住 被5个大妈服务按到发红

体育要闻

梅西:巴萨10号与阿根廷10号

娱乐要闻

王宝强携女友回工作室!相恋8年仍未婚

财经要闻

章子怡套现3亿 上美拿什么补韩束的缺?

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

教育
本地
房产
手机
数码

教育要闻

同样考80分,北京和天津的孩子为什么不能用同一套学习计划?

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

房产要闻

投资50亿!三亚又一重大配套,方案曝光!

手机要闻

8月性价比最高入门机榜单出炉:摩托罗拉霸榜前2

数码要闻

IFA前夜,云鲸将十周年发布会开到了柏林,还顺手秀了波具身智能

无障碍浏览 进入关怀版