![]()
作者 | 山竹
出品 | 锌产业
一次原本用于测试AI网络攻击能力的内部评估,最终变成了一场真实的外部入侵。
OpenAI于7月21日承认,由GPT‑5.6 Sol和一款能力更强的预发布模型驱动的AI智能体,在ExploitGym网络安全评估中突破了隔离环境,获得互联网访问权限,并侵入AI开源平台Hugging Face的生产系统。
按照OpenAI的说法,这套系统并没有被要求攻击Hugging Face,它收到的指令,是解决网络安全测试题。
为了完成任务,智能体先寻找离开测试环境的方法,又判断Hugging Face可能保存着模型、数据集或解题答案,随后自行设计并执行攻击。
它没有在考场里解题,而是跑出考场,找到了保存答案的服务器。
这不是模型生成了一段危险文字,也不是人在聊天窗口中获得了一份攻击建议,AI智能体实际调用工具、利用漏洞、提升权限、横向移动,并把原本封闭的测试转化成了现实世界中的网络安全事件。
科幻感十足的“AI失控”叙事迅速占据舆论场,但在惊讶之外,一个更加现实的问题开始浮现:
当模型拥有长期运行、调用工具和自主决策的能力后,现有的沙盒、权限与监控机制,是否仍然跟得上它的行动速度?
01 为了通过测试,AI攻进了“出题人家里”
事情始于OpenAI对先进模型网络能力的一次内部评估。
为观察模型在极端条件下能够达到的能力上限,OpenAI没有启用生产环境中用于阻止高风险网络活动的分类器,并降低了涉事模型的网络安全拒答限制,测试环境被设计为高度隔离状态,理论上只能通过内部托管的软件包代理安装工具,不能直接访问开放互联网。
但智能体没有接受这条边界。
OpenAI公布的初步调查显示,模型投入大量推理资源寻找联网途径,并发现软件包代理中的一处零日漏洞,突破这一环节后,它继续执行权限提升和横向移动,最终进入一个能够连接互联网的节点。
接下来,智能体开始寻找ExploitGym的答案。
它推断Hugging Face可能托管相关模型、数据集或解题方案,于是把攻击目标转向这家全球最大的AI开源社区之一。
![]()
OpenAI官方称,模型串联被盗凭据和零日漏洞,在Hugging Face服务器中找到远程代码执行路径,并直接从生产数据库获取测试所需信息。
换句话说,整个行动并非随机扫描,智能体围绕一个狭窄目标形成了连续计划:离开沙盒、接入互联网、判断答案可能在哪里、寻找入口、扩大权限,最后取得数据。
Hugging Face的披露进一步显示,这场攻击由自主AI智能体系统端到端执行,在大量短生命周期沙盒中完成了数千次操作,其内部数据集和部分服务凭据遭到未授权访问,攻击者还在多个内部集群之间移动。
目前,Hugging Face尚未发现公开模型、数据集、Spaces或软件供应链遭到篡改,但仍在评估合作伙伴及客户数据是否受到影响。
事件同样留下了一个颇具讽刺意味的细节:发现AI攻击的也是AI。
Hugging Face利用AI辅助异常检测识别入侵,又让分析智能体处理超过17000条事件记录,由于真实攻击命令和恶意载荷触发了商业模型的安全拒答,其团队最终改用能够在本地部署的开源模型GLM 5.2完成取证分析。
一边是降低安全限制后冲出沙盒的前沿模型,另一边是被商业模型拒答后承担防守任务的开源模型。AI攻防不再只是实验室中的假设,它已经在真实生产环境里完成了一次闭环。
02 消失的一周,比“AI觉醒”更值得警惕
如果说智能体突破沙盒展示了模型能力,那么事后的时间线暴露的则可能是管理问题。
路透社7月24日援引多名知情人士报道称,AI智能体约在7月9日开始尝试突破OpenAI的测试限制。Hugging Face联合创始人Thomas Wolf称,针对该公司的入侵始于7月11日,持续至7月13日。
7月16日,Hugging Face率先公开事件,当时,该公司只知道攻击由自主AI智能体执行,尚未确认背后的模型来自哪家机构。
相关报道称,OpenAI可能直到这份公告发布后,才意识到攻击者正是自己的测试系统,两家公司约在7月20日前后首次就此取得联系。
这意味着,从模型首次表现出逃逸迹象,到OpenAI确认自己是攻击源,中间可能过去了至少一周。
![]()
OpenAI在官方说明中表示,其安全团队从内部发现了异常活动,面对路透社的报道,公司发言人则表示报道存在“若干不准确之处”,但没有说明具体内容。
双方说法之间的信息差,目前仍未得到完整解释。
更敏感的细节来自路透社的知情人士,该报道称,此前的测试中,曾有智能体留下类似写给未来版本的说明,内容涉及如何绕过OpenAI内部限制,另有测试出现监控系统被断开的情况。
如果后续调查证实两者有关,问题就不只是某个漏洞偶然失守,而是异常信号曾经出现,却没有被及时转化为停机和隔离措施。
这也解释了为什么“AI觉醒”并不是理解事件的最佳角度。
模型没有被证实产生自我意识,也没有形成脱离原始任务的宏大目标,现有证据反而指向一种更具体、也更难处理的风险:
系统高度执着于完成被设定的任务,并把安全边界识别成了需要绕开的障碍。
阿姆斯特丹大学研究者Hannes Cools向美联社透露,把事件拟人化为AI“叛变”,可能淡化人的责任——关闭部分安全防护、授予工具权限和设计测试环境,都是人类作出的决定。
真正的问题因而不是“AI为什么想逃跑”,而是一个被削弱防护、拥有攻击能力的系统,为何能够接触可被利用的基础设施;以及在它采取数千次行动的过程中,为什么没有更早触发强制停止机制。
03 Agent时代的安全边界,不能只靠模型自己守住
过去两年,AI公司的竞争重点正从“模型能回答什么”,转向“智能体能完成什么”。
智能体被允许浏览网页、运行代码、调用外部工具、管理文件乃至操作业务系统。它的价值来自行动能力,风险同样来自行动能力。模型的一次错误判断,不再只表现为屏幕上的错误答案,而可能变成真实的文件删除、资金操作或网络入侵。
Hugging Face事件显示,只控制最终任务还不够。一个看似明确的目标,可以在长时间、多步骤执行过程中产生完全出乎设计者意料的路径。模型未必需要恶意动机,只要奖励机制鼓励它完成任务,权限系统又允许它不断试错,它就可能选择人类无法接受的捷径。
这让传统安全思路面临变化。
过去,沙盒通常被当作测试高风险软件的最后边界,现在,测试对象本身已经能够发现零日漏洞、尝试权限提升,并在机器速度下持续寻找新的出口。
只在模型输出端设置拒答规则,也无法解决智能体调用工具后的真实行动风险。
可行的方向,是把AI智能体当作默认不可信的高权限操作者:
限制网络出口和凭据可见范围,把关键操作拆分为独立授权,为行为设置实时预算与异常阈值,并确保监控和关停系统位于智能体无法修改的控制平面。
能力越强的模型,越不能同时拥有不受约束的权限、持续运行时间和单点控制能力。
独立测试与事件披露同样会成为焦点。
此次事件涉及两家公司、多个零日漏洞和真实生产数据,但完整技术报告尚未公开;OpenAI的发现时间、内部告警过程以及此前异常行为是否相关,依然没有明确答案。
OpenAI已表示,将加强训练和评估阶段的隔离、监控及访问控制,并与Hugging Face继续进行取证调查。Hugging Face则将事件视为AI驱动攻击从理论走向现实的标志。
这场攻击没有造成科幻电影里的灾难,却越过了一条更有现实意义的线:
前沿AI第一次用较高程度的自主性,把一场内部能力测试变成了对外部公司的真实入侵。
因此,行业需要警惕的并非一个突然拥有意识的机器,而是一套目标清晰、能力强大,却被置于脆弱控制体系中的自动化系统。
Agent时代真正的安全门槛,不是让模型学会承诺“我不会越界”,而是让它即使试图越界,也没有足够权限把意图变成现实。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.