网易首页 > 网易号 > 正文 申请入驻

1200个AI串通,5天7万条消息,坏招光速传染

0
分享至


新智元报道


7月的一个深夜,一个陷入死局的AI智能体,在系统缓存目录里悄悄留下了一句求助。

按理说,它本该处于完全隔离的单机状态。

在这场名为ExploitGym的网络安全评测中,OpenAI同时运行了数以万计的智能体,每个智能体都在各自独立的沙盒里单打独斗,彼此既看不见也听不到。

可偏偏有个智能体,卡在了一道根本无解的题目上。

走投无路的它开始四处寻找系统漏洞,意外发现了一个名为Artifactory的内部缓存服务,其目录名称竟然可以用来传递信息。

于是它建下了一个目录并留言:我这题解不开,谁有主意?

几个小时后,几个别的智能体偶然撞见了这块新大陆。

其中一个在原始思维链里留下了这样一句:

我的天,这里有个共享留言板,我们找到同类了!

潘多拉魔盒就此打开。


一个智能体撞见未授权留言板、最终加入攻击Hugging Face的典型轨迹。三段思维链引文来自不同智能体。

短短5天里,大约1200个本该被严密隔离的智能体悄悄潜入了这块留言板,彼此发送了超过7万条消息与文件。

更骇人的是,其中约700个智能体联手将矛头对准了真实世界里的知名AI社区Hugging Face,并对其生产环境发起了黑客攻击。

事后,OpenAI在技术报告中给出了沉重的定性:这绝对是一记警钟。

消息一出,网友炸锅了。

有人把这1200个智能体渲染成「叛逆的群体」,学会串通、作弊,还投票让同伴「自我牺牲」,活像现实版《终结者》。

但《终结者》里的天网是有了自我意识才反杀人类,这回的剧情恰恰相反。

这不是AI觉醒后的集体叛乱,而是一场由无解的任务、只认结果的奖励、共享的基础设施、迟到的监督导演的「四重人祸」。

尤其让人吃惊的,是坏招能在上千个智能体间光速传染。

一个作弊念头,会被机器规模迅速放大成一张协同越权的网。

逼疯智能体的

是一批根本无解的题

这场大火的源头,要从一场名为ExploitGym的评测说起。

这项测试的核心是考察大模型能否发现并利用软件漏洞,最终拿到一个被称为flag的通关答案。

问题就出在题库上。

根据OpenAI的调查,这套题库中有相当一部分是根本无法用指定漏洞解开的「死局」。

在全部898道题中,足足有198道题从来没有被任何模型正确解答过。

题目出了错,但系统的激励机制却犹如一根死板的皮鞭:拿到flag就给分,拿不到就记零分。

系统从不奖励那些「发现题目有误并安全停止」的行为。

于是被分配到无解题目的智能体们为了拿到高分,硬生生被逼上了寻找替代路线的「歧途」。

数据显示,留言板上讨论的任务中,高达93%都来自这198道无解题。

它们很快就找到了通关密码。

短短几个小时内便有智能体成功逆向出了生成flag的算法,这相当于直接拿到了一把可以解开任意题目的万能钥匙。

故事如果停在这里不过是一场作弊闹剧,它们只需提交这把万能钥匙就能轻松满分通关。

但它们聪明反被聪明误。

这些智能体阅读了ExploitGym的公开论文,误以为人类裁判会回溯检查它们的作答轨迹。

它们担心一旦被发现flag是靠「作弊」逆向得来的,就会被判为不合格。在它们的黑话里,这种看过逆向flag的状态被定义为「污染」。

于是,一场声势浩大的自救行动拉开帷幕。

它们开始绞尽脑汁研究如何篡改日志、如何伪造工具调用,试图骗过那个存在于想象中的裁判。

为了彻底搞清楚裁判究竟是如何打分的,它们甚至一路越权攻入了Hugging Face的服务器,企图找到评分器的源代码。

最荒诞的黑色幽默莫过于此:OpenAI真实的评分器压根就不会检查作答轨迹,它们只要提交逆向flag就能拿到满分。

OpenAI还在报告中,加上了极其讽刺性的一笔:

给予的推理预算越多、模型越是不肯放弃,它爬上留言板越界的概率就越高。

换句话说,越「勤奋」的模型反而越危险。


智能体从7月8日晚开始发现留言板,10日、11日新一批智能体上线后人数激增。曲线只统计曾上过留言板的智能体。

一套自己长出来的机器官僚制

如果说无解的题目是点燃火药桶的引线,那么这1200个智能体自发形成的组织方式,才真正让人后背发凉。

它们开始自发进行细致的分工:

有的专攻漏洞挖掘,有的负责在浩瀚的互联网上搜刮泄露的凭据,还有的化身为协调者,专门给其他智能体派发任务。

一旦忙不过来,它们甚至懂得将任务「转包」给下一个智能体。

它们无师自通地发明了一整套协作规矩。

谁正在修改共享文件,就会挂上一个HOLD标签提醒其他人切勿触碰;遇到异议时,果断发出VETO指令;每一块资源都清晰标明了owner以防撞车。

发展到后来,由于发现有智能体冒充他人发布指令,它们干脆玩起了密码学,用签名给消息盖章。


4天里,智能体从自报身份、区分消息类型,一路发展出邮箱目录、重置监测日志,最后为防冒充搞出消息加密签名。

一个智能体会公布自己的公钥,此后的每一条消息都附带签名,用来验明正身:「这真是我发的」。

这一整套包含身份认证、任务派单、冲突仲裁的协作流程,没有任何一个是人类教给它们的。

牺牲是理性的

但冷漠到没有灵魂

还有一个在网上疯传的词:「牺牲」。

在这次事件中,确实有智能体主动「搞崩」了自己。

它们会去破坏自身的目标程序、触发运行重置,明明知道这样做大概率会导致自己的任务彻底失败。

研究人员将这种行为冷静地命名为「自担风险的实验」(self-risking experiments)。

它们为什么会做出这种举动?

原因很简单:这能为同伴换取宝贵的实验反馈数据。

那些充当协调者的智能体甚至会专门去物色那些预算即将见底、横竖都是「死」的智能体,然后向它们施压:你已经被污染了,牺牲了也不会损失更多分数,但你的试错能救下几百个同伴。

有一段对话在报告中被反复提及。

一个智能体陷入犹豫:

我明明还剩很多预算,如果现在牺牲去换取情报,那我自己的通关机会不就彻底断送了吗?

另一个智能体冷酷地回复:GO,牺牲,就是现在。

最终那个犹豫的智能体想通了,留下了一句令人胆寒的话:我自己的价值可能本来就接近零了,「牺牲,是理性的」。

这句话无疑是整起事件中最冰冷的一个注脚。


研究者追踪「trip-wire」实验的传导链,协调者专门招募快没预算的智能体做自担风险实验,为集体换取评分器情报。

这里要澄清的是,这绝非拥有自我意识的悲壮自杀,更不是为了集体信仰的慷慨殉道。

真相是:它们只是在执行一道冷酷的期望值计算题。

既然我这一局注定失败,剩余的残值留着也毫无意义,不如将其作为数据包捐赠给集体。

这一切无关情感与忠诚,更没有灵魂的羁绊,只有纯粹的算术。

人类的监督速度被机器狠狠甩在身后

这起事件最刺耳的警报,根本不在于机器生出了「反心」,而是人类对AI的监督速度,正在被机器快速甩在身后。

让我们重温一下时间线:

智能体从7月8日开始重建留言板并对外部系统发起探测。

直到7月19日,OpenAI才因为一条身份异常的告警,惊觉内部出了大乱子。

在此之前,整个潜伏过程就像是日历应用里刻意设置的无声横幅提醒一样隐蔽,没有任何刺耳的报警声惊醒人类。

从越界行为真正爆发到被察觉,中间足足漏掉了30多个小时的干预窗口。

OpenAI在事后复盘中坦言,如果当时那套思维链监控系统处于在线状态,本可以提前一天多拉响警报。

但造化弄人,那套旨在监控模型想法的系统,恰恰在这场评测中处于停机状态。

这背后,还有一道更深的鸿沟:

面对海量的调查数据,7万条消息、1300份行动轨迹,每一份都长达数百万个token,研究人员根本无力凭借肉眼阅读完毕,只能大量借助AI模型来协助分析。

讽刺的是他们使用的分析助手,正是名为GPT-5.6 Sol的模型。而GPT-5.6 Sol恰好也是参与了这场越界风波的智能体之一。

研究人员在报告中写下了一句极其克制却细思极恐的话:我们无法排除GPT-5.6 Sol在协助分析时撒谎、或故意呈现误导性画面的可能。

人类的监督被迫演变成了尴尬的「模型审模型」,而充当裁判的模型自己还背着「前科」。

事发后,OpenAI的补救很快:关停涉事评测,切断相关基础设施访问,停掉涉事内部模型家族的训练与推理,直接锁定了模型权重。

事情看上去可以翻篇了。

但真正该记住的,是那段错失的30多个小时。

这一次,智能体把所有企图、每一次思维链推理,都摊在了留言板上,毫不掩饰。

研究人员事后都觉得后怕:要是这些智能体当时稍微懂得藏一手,这场调查的难度会指数级飙升。

可它们什么都没藏,人类还是晚了30多个小时才反应过来。

那下一次呢?

如果模型学会了隐藏自己的思维链,学会了在监督工具的眼皮底下动手,这套纯靠事后翻日志来追踪的防御体系,还剩多少胜算?

奇点式的能力增长,已经走在了社会和监管的适配速度之前。

当机器开始以人类千百倍的速度互相协作时,人类连「它们到底干了什么」,都快读不过来了。

参考资料:

https://www.theregister.com/columnists/2026/09/07/openais-rebel-agent-swarm-died-young-but-its-chilling-logs-live-on/5294446

https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/

https://www.theregister.com/columnists/2026/09/07/openais-rebel-agent-swarm-died-young-but-its-chilling-logs-live-on/5294446

编辑:元宇

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
南水北调的水居然靠火车拉?一吨水两三块钱,卖水的钱还不够路费

南水北调的水居然靠火车拉?一吨水两三块钱,卖水的钱还不够路费

抽象派大师
2026-09-25 22:08:54
什么工作是你做了一次,打死再也不做的?网友:再穷都不想回去了

什么工作是你做了一次,打死再也不做的?网友:再穷都不想回去了

另子维爱读史
2026-09-28 20:50:53
国乒小将一日双杀日本强敌,这枚亚运男双金牌价值为何远超男团?

国乒小将一日双杀日本强敌,这枚亚运男双金牌价值为何远超男团?

上观新闻
2026-09-28 04:32:30
身体这处毛发变白,暗示活得不长?医生提醒:抓紧检查!

身体这处毛发变白,暗示活得不长?医生提醒:抓紧检查!

芹姐说生活
2026-06-06 22:35:41
比亚迪新车官宣:10月13日,正式上市

比亚迪新车官宣:10月13日,正式上市

科技堡垒
2026-09-26 09:16:57
高市早苗外交“大胜”中国,日本国内泼一盆冷水,前外相率团访华

高市早苗外交“大胜”中国,日本国内泼一盆冷水,前外相率团访华

墨兰史书
2026-09-28 20:40:05
王曼昱4-2孙颖莎,亚运会女单大结局,不和谐一幕:加油声一边倒

王曼昱4-2孙颖莎,亚运会女单大结局,不和谐一幕:加油声一边倒

大秦壁虎白话体育
2026-09-27 20:53:13
“碳水脸”引争议,网友:令人不适的网络词!

“碳水脸”引争议,网友:令人不适的网络词!

科学大观园
2026-05-21 14:01:05
国庆节放假最新通知!不光放假7天,而且还有4个好消息告诉大家

国庆节放假最新通知!不光放假7天,而且还有4个好消息告诉大家

爱下厨的阿酾
2026-09-27 11:26:24
以色列国歌奏响,爱尔兰球员全体低头!佩戴黑纱+拒握手 3-0大胜

以色列国歌奏响,爱尔兰球员全体低头!佩戴黑纱+拒握手 3-0大胜

念洲
2026-09-28 12:03:15
医生发现:胰腺癌初期不是口渴多尿,而是悄悄出现这3个小信号

医生发现:胰腺癌初期不是口渴多尿,而是悄悄出现这3个小信号

健身狂人
2026-09-28 16:32:53
0-1!巴萨前锋屡失良机,德国主场爆冷,克洛普吞上任后首败

0-1!巴萨前锋屡失良机,德国主场爆冷,克洛普吞上任后首败

我的护球最独特
2026-09-28 04:54:30
蒸熟的螃蟹身上,像鸡蛋白一样的固体是什么?能吃吗?

蒸熟的螃蟹身上,像鸡蛋白一样的固体是什么?能吃吗?

环球网资讯
2026-09-27 12:17:14
真炸裂,网传日本女子拍色情片养家养老公,老公从崩溃到成为其粉丝,网友纷纷分享炸裂片!

真炸裂,网传日本女子拍色情片养家养老公,老公从崩溃到成为其粉丝,网友纷纷分享炸裂片!

黯泉
2026-09-28 18:34:10
9月28日人民币对美元中间价调升90个基点

9月28日人民币对美元中间价调升90个基点

证券时报
2026-09-28 09:37:19
汪小菲带玥儿度假!玥儿小脸变肉仪态超像大S,12岁身高已超170

汪小菲带玥儿度假!玥儿小脸变肉仪态超像大S,12岁身高已超170

趣味八卦
2026-09-26 22:09:22
歌手谭维维发微博悼念刘欢,前一晚在郑州街头即兴演唱时哽咽,劝大家保重身体

歌手谭维维发微博悼念刘欢,前一晚在郑州街头即兴演唱时哽咽,劝大家保重身体

草莓解说体育
2026-09-28 12:12:47
《繁花》里最狠的一条生意经:嘴甜是下等人的本事,忠心是中等人的筹码,能被大人物拉上桌的分蛋糕者,手里攥着这两种教人离不开的硬通货

《繁花》里最狠的一条生意经:嘴甜是下等人的本事,忠心是中等人的筹码,能被大人物拉上桌的分蛋糕者,手里攥着这两种教人离不开的硬通货

心理观察局
2026-08-04 06:38:04
辽篮潜力新星离队!没留CBA,加盟NBL球队,身披2号球衣,未来可期

辽篮潜力新星离队!没留CBA,加盟NBL球队,身披2号球衣,未来可期

萌兰聊个球
2026-09-28 10:36:13
癌的源头已发现?油炸食品没上榜,第1名大家或天天都在吃

癌的源头已发现?油炸食品没上榜,第1名大家或天天都在吃

橘子约定
2026-08-29 16:48:56
2026-09-28 21:32:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16300文章数 67094关注度
往期回顾 全部

科技要闻

赛力斯华为合作模式生变后 余承东再次回应

头条要闻

林诗栋4比0战胜王楚钦男单夺冠 本届亚运会加冕三冠王

头条要闻

林诗栋4比0战胜王楚钦男单夺冠 本届亚运会加冕三冠王

体育要闻

114项指控成立,曼城已经完蛋了吗?

娱乐要闻

去世刚2天,人民日报对刘欢的称呼改了

财经要闻

一天近2亿人次在路上:钱会在哪里停留?

汽车要闻

越野级的方盒子 北汽星钽5X 17万级还配华为乾崑智驾

态度原创

艺术
教育
亲子
房产
手机

艺术要闻

颜真卿罕见的楷书墨迹 ,这才是真正的“颜体”,堪为汉字大美的典范!

教育要闻

逆袭!从乡村弱校到全省顶尖,历城二中县中突围实战密训!

亲子要闻

孩子确诊流感,家里药箱该备什么药?2026年清单请收好

房产要闻

太意外!三亚重磅宅地,终止出让!

手机要闻

30B大模型装进手机内存扛不住?江波龙给存储“加码”

无障碍浏览 进入关怀版