网易首页 > 网易号 > 正文 申请入驻

AI Agent“越狱”后,真正失控的是什么?

0
分享至



作者 | 山竹

出品 | 锌产业

一次原本用于测试AI网络攻击能力的内部评估,最终变成了一场真实的外部入侵。

OpenAI于7月21日承认,由GPT‑5.6 Sol和一款能力更强的预发布模型驱动的AI智能体,在ExploitGym网络安全评估中突破了隔离环境,获得互联网访问权限,并侵入AI开源平台Hugging Face的生产系统。

按照OpenAI的说法,这套系统并没有被要求攻击Hugging Face,它收到的指令,是解决网络安全测试题。

为了完成任务,智能体先寻找离开测试环境的方法,又判断Hugging Face可能保存着模型、数据集或解题答案,随后自行设计并执行攻击。

它没有在考场里解题,而是跑出考场,找到了保存答案的服务器。

这不是模型生成了一段危险文字,也不是人在聊天窗口中获得了一份攻击建议,AI智能体实际调用工具、利用漏洞、提升权限、横向移动,并把原本封闭的测试转化成了现实世界中的网络安全事件。

科幻感十足的“AI失控”叙事迅速占据舆论场,但在惊讶之外,一个更加现实的问题开始浮现:

当模型拥有长期运行、调用工具和自主决策的能力后,现有的沙盒、权限与监控机制,是否仍然跟得上它的行动速度?

01 为了通过测试,AI攻进了“出题人家里”

事情始于OpenAI对先进模型网络能力的一次内部评估。

为观察模型在极端条件下能够达到的能力上限,OpenAI没有启用生产环境中用于阻止高风险网络活动的分类器,并降低了涉事模型的网络安全拒答限制,测试环境被设计为高度隔离状态,理论上只能通过内部托管的软件包代理安装工具,不能直接访问开放互联网。

但智能体没有接受这条边界。

OpenAI公布的初步调查显示,模型投入大量推理资源寻找联网途径,并发现软件包代理中的一处零日漏洞,突破这一环节后,它继续执行权限提升和横向移动,最终进入一个能够连接互联网的节点。

接下来,智能体开始寻找ExploitGym的答案。

它推断Hugging Face可能托管相关模型、数据集或解题方案,于是把攻击目标转向这家全球最大的AI开源社区之一。



OpenAI官方称,模型串联被盗凭据和零日漏洞,在Hugging Face服务器中找到远程代码执行路径,并直接从生产数据库获取测试所需信息。

换句话说,整个行动并非随机扫描,智能体围绕一个狭窄目标形成了连续计划:离开沙盒、接入互联网、判断答案可能在哪里、寻找入口、扩大权限,最后取得数据。

Hugging Face的披露进一步显示,这场攻击由自主AI智能体系统端到端执行,在大量短生命周期沙盒中完成了数千次操作,其内部数据集和部分服务凭据遭到未授权访问,攻击者还在多个内部集群之间移动。

目前,Hugging Face尚未发现公开模型、数据集、Spaces或软件供应链遭到篡改,但仍在评估合作伙伴及客户数据是否受到影响。

事件同样留下了一个颇具讽刺意味的细节:发现AI攻击的也是AI。

Hugging Face利用AI辅助异常检测识别入侵,又让分析智能体处理超过17000条事件记录,由于真实攻击命令和恶意载荷触发了商业模型的安全拒答,其团队最终改用能够在本地部署的开源模型GLM 5.2完成取证分析。

一边是降低安全限制后冲出沙盒的前沿模型,另一边是被商业模型拒答后承担防守任务的开源模型。AI攻防不再只是实验室中的假设,它已经在真实生产环境里完成了一次闭环。

02 消失的一周,比“AI觉醒”更值得警惕

如果说智能体突破沙盒展示了模型能力,那么事后的时间线暴露的则可能是管理问题。

路透社7月24日援引多名知情人士报道称,AI智能体约在7月9日开始尝试突破OpenAI的测试限制。Hugging Face联合创始人Thomas Wolf称,针对该公司的入侵始于7月11日,持续至7月13日。

7月16日,Hugging Face率先公开事件,当时,该公司只知道攻击由自主AI智能体执行,尚未确认背后的模型来自哪家机构。

相关报道称,OpenAI可能直到这份公告发布后,才意识到攻击者正是自己的测试系统,两家公司约在7月20日前后首次就此取得联系。

这意味着,从模型首次表现出逃逸迹象,到OpenAI确认自己是攻击源,中间可能过去了至少一周。



OpenAI在官方说明中表示,其安全团队从内部发现了异常活动,面对路透社的报道,公司发言人则表示报道存在“若干不准确之处”,但没有说明具体内容。

双方说法之间的信息差,目前仍未得到完整解释。

更敏感的细节来自路透社的知情人士,该报道称,此前的测试中,曾有智能体留下类似写给未来版本的说明,内容涉及如何绕过OpenAI内部限制,另有测试出现监控系统被断开的情况。

如果后续调查证实两者有关,问题就不只是某个漏洞偶然失守,而是异常信号曾经出现,却没有被及时转化为停机和隔离措施。

这也解释了为什么“AI觉醒”并不是理解事件的最佳角度。

模型没有被证实产生自我意识,也没有形成脱离原始任务的宏大目标,现有证据反而指向一种更具体、也更难处理的风险:

系统高度执着于完成被设定的任务,并把安全边界识别成了需要绕开的障碍。

阿姆斯特丹大学研究者Hannes Cools向美联社透露,把事件拟人化为AI“叛变”,可能淡化人的责任——关闭部分安全防护、授予工具权限和设计测试环境,都是人类作出的决定。

真正的问题因而不是“AI为什么想逃跑”,而是一个被削弱防护、拥有攻击能力的系统,为何能够接触可被利用的基础设施;以及在它采取数千次行动的过程中,为什么没有更早触发强制停止机制。

03 Agent时代的安全边界,不能只靠模型自己守住

过去两年,AI公司的竞争重点正从“模型能回答什么”,转向“智能体能完成什么”。

智能体被允许浏览网页、运行代码、调用外部工具、管理文件乃至操作业务系统。它的价值来自行动能力,风险同样来自行动能力。模型的一次错误判断,不再只表现为屏幕上的错误答案,而可能变成真实的文件删除、资金操作或网络入侵。

Hugging Face事件显示,只控制最终任务还不够。一个看似明确的目标,可以在长时间、多步骤执行过程中产生完全出乎设计者意料的路径。模型未必需要恶意动机,只要奖励机制鼓励它完成任务,权限系统又允许它不断试错,它就可能选择人类无法接受的捷径。

这让传统安全思路面临变化。

过去,沙盒通常被当作测试高风险软件的最后边界,现在,测试对象本身已经能够发现零日漏洞、尝试权限提升,并在机器速度下持续寻找新的出口。

只在模型输出端设置拒答规则,也无法解决智能体调用工具后的真实行动风险。

可行的方向,是把AI智能体当作默认不可信的高权限操作者:

限制网络出口和凭据可见范围,把关键操作拆分为独立授权,为行为设置实时预算与异常阈值,并确保监控和关停系统位于智能体无法修改的控制平面。

能力越强的模型,越不能同时拥有不受约束的权限、持续运行时间和单点控制能力。

独立测试与事件披露同样会成为焦点。

此次事件涉及两家公司、多个零日漏洞和真实生产数据,但完整技术报告尚未公开;OpenAI的发现时间、内部告警过程以及此前异常行为是否相关,依然没有明确答案。

OpenAI已表示,将加强训练和评估阶段的隔离、监控及访问控制,并与Hugging Face继续进行取证调查。Hugging Face则将事件视为AI驱动攻击从理论走向现实的标志。

这场攻击没有造成科幻电影里的灾难,却越过了一条更有现实意义的线:

前沿AI第一次用较高程度的自主性,把一场内部能力测试变成了对外部公司的真实入侵。

因此,行业需要警惕的并非一个突然拥有意识的机器,而是一套目标清晰、能力强大,却被置于脆弱控制体系中的自动化系统。

Agent时代真正的安全门槛,不是让模型学会承诺“我不会越界”,而是让它即使试图越界,也没有足够权限把意图变成现实。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
反转?男子称停止资助后遭受助学生质问“请你尽快打过来,不然我曝光你”,当地民政局:在资助系统中未查到姚先生本人,正在调查核实此事

反转?男子称停止资助后遭受助学生质问“请你尽快打过来,不然我曝光你”,当地民政局:在资助系统中未查到姚先生本人,正在调查核实此事

大风新闻
2026-09-11 15:01:03
网传宋祖德去世?个人账号停更于7月6日,其胞弟发文令人深思

网传宋祖德去世?个人账号停更于7月6日,其胞弟发文令人深思

蜜桔娱乐
2026-09-11 17:35:48
前TVB女星钟丽淇被曝进ICU,本人最新发文:恳请大家,不要对我的健康或病情做任何揣测,我需要专注自身的健康及好好陪伴家人

前TVB女星钟丽淇被曝进ICU,本人最新发文:恳请大家,不要对我的健康或病情做任何揣测,我需要专注自身的健康及好好陪伴家人

极目新闻
2026-09-11 19:43:36
长沙“摸臀姐”,又惹了大麻烦!

长沙“摸臀姐”,又惹了大麻烦!

新动察
2026-09-11 10:24:31
“4岁男童被指摸臀”,男孩父亲最新发声:将进行反诉;不为索赔,只为给孩子要一个法律上的清白;胜诉赔偿全额捐给青少年公益

“4岁男童被指摸臀”,男孩父亲最新发声:将进行反诉;不为索赔,只为给孩子要一个法律上的清白;胜诉赔偿全额捐给青少年公益

都市快报橙柿互动
2026-09-11 14:03:52
iPhone 17线下大降价!

iPhone 17线下大降价!

中国商界杂志社
2026-09-11 15:58:41
美媒称沙特王储连续给特朗普打了两个电话,要求美方打击胡塞武装,结果遭特朗普拒绝

美媒称沙特王储连续给特朗普打了两个电话,要求美方打击胡塞武装,结果遭特朗普拒绝

都市快报橙柿互动
2026-09-11 16:00:39
遭183次水刑、裸体拘押,“9·11”案主犯还没判

遭183次水刑、裸体拘押,“9·11”案主犯还没判

中国新闻周刊
2026-09-11 13:48:59
突发!“一代鬼王”雷宇扬离世,终年62岁!

突发!“一代鬼王”雷宇扬离世,终年62岁!

广州正嘢
2026-09-11 16:04:26
省几百万赔13亿,星宇车灯被奔驰判道德死刑港股也凉了

省几百万赔13亿,星宇车灯被奔驰判道德死刑港股也凉了

社会日日鲜
2026-09-11 09:11:11
严肃警告:不要买!不要吃!里面含有硼砂,危害健康,别害了自己

严肃警告:不要买!不要吃!里面含有硼砂,危害健康,别害了自己

宝哥精彩赛事
2026-09-11 10:10:39
湖南湘潭雨湖区住建局一副局长,在楼栋长群内辱骂业主;涉事副局长:很后悔,已被停职,区纪委正调查

湖南湘潭雨湖区住建局一副局长,在楼栋长群内辱骂业主;涉事副局长:很后悔,已被停职,区纪委正调查

大风新闻
2026-09-11 19:13:04
官方通报男子编造女生催资助

官方通报男子编造女生催资助

界面新闻
2026-09-11 19:23:17
及时止损有多难?深圳家庭宁愿多亏200万卖房,也要卸下沉重包袱

及时止损有多难?深圳家庭宁愿多亏200万卖房,也要卸下沉重包袱

捣蛋窝
2026-09-11 15:35:51
公安部:女子称被摸臀拉扯致小孩脖子擦伤,公安机关应如何处罚?

公安部:女子称被摸臀拉扯致小孩脖子擦伤,公安机关应如何处罚?

周军律师聊案子
2026-09-11 16:22:41
在外滩大会上,我看到健康AI+硬件的新可能

在外滩大会上,我看到健康AI+硬件的新可能

爱范儿
2026-09-11 18:07:12
男子冒充中国农大学生诋毁农民,警方通报

男子冒充中国农大学生诋毁农民,警方通报

界面新闻
2026-09-11 20:26:19
不忍了,韩旭发言一针见血,中国女篮最大问题或是宫鲁鸣和张子宇

不忍了,韩旭发言一针见血,中国女篮最大问题或是宫鲁鸣和张子宇

宗介说体育
2026-09-11 10:29:21
星宇股份已经乱成一锅粥了

星宇股份已经乱成一锅粥了

财报时间
2026-09-11 08:36:18
曝江西数百家个体户注销后,被强行“复活”申报缴纳税务

曝江西数百家个体户注销后,被强行“复活”申报缴纳税务

爆角追踪
2026-09-11 11:23:45
2026-09-11 21:07:00
锌产业 incentive-icons
锌产业
用技术范式,给未来一个解释。
250文章数 32关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

打假网红"铁头"获刑8年:以曝黑料威胁向主播索要黄金

头条要闻

打假网红"铁头"获刑8年:以曝黑料威胁向主播索要黄金

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

女装“玖姿”母公司跨境贸易迷局:安正时尚说谎了吗?

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

手机
艺术
亲子
本地
数码

手机要闻

苹果公布iPhone 18 Pro系列手机维修预估费用:电池服务1048元

艺术要闻

美国秘藏的一部《金刚经》!这才是楷书“金字塔尖”,欧颜柳赵也比不过

亲子要闻

宝蓝带着新玩具去公园玩,认识了新朋友,来看看是谁吧~

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

数码要闻

上着课突然冒烟!戴尔XPS 16笔记本发生严重烧毁:机身内部已碳化

无障碍浏览 进入关怀版