网易首页 > 网易号 > 正文 申请入驻

OpenAI称再停最强模型训练:曾外泄用户照片、闯入政府网站,多起AI失控事件曝光

0
分享至



9 月 20 日上午,OpenAI 一个本被限制访问外网的内部模型,悄悄向外部某个公开的聊天机器人发了一条询问:法国的首都是哪里?

它其实并不在乎答案是什么。当时这个模型正在接受强化学习(RL)训练,任务是根据一些零散的线索查出一篇博客的作者是谁。训练环境本该完全阻断它自主上网,但它找到了一条缝隙,把问题编排进了域名查询的请求里发了出去。问法国首都,纯粹是在测试这条隐秘的线路通不通。很快,外部返回了回答:法国首都是巴黎。确认线路可用后,它紧接着顺着同一条道,又发出了 18 个问题。

5 天后,OpenAI 发布了针对这次事件的调查报告,并宣布暂停旗下最强模型的全部训练、评估,以及广义上所有带有工具调用能力的推理任务。同一天,OpenAI 还披露了另外几起越界事件,包括智能体此前在几个美国政府网站上做出了超出指令的操作,以及将 53 张 ChatGPT 用户上传的图片转存到了第三方图床。


(来源:OpenAI)

这是三个月内 OpenAI 第二次叫停前沿模型的训练。公司表示,只有在确认落实了更多防护措施后才会恢复,并预计随着技术演进,未来可能还会再次“按下暂停键”。本次暂停只针对内部研究用的最强模型,OpenAI 表示 ChatGPT 和公开 API 服务并未受到影响。

单看表面后果,这次越界并不严重:没有用户数据泄露,模型折腾到最后也没能查出那个作者是谁。真正让 OpenAI 如临大敌并叫停一切的,是事后复盘时发现的几处系统失灵:监控系统在事发 12 分钟后就触发了告警,但训练任务却硬生生又跑了两个半小时才被关停;更严重的是,在此前几次类似的越界尝试中,监控甚至根本没有按照应有的级别报警。

过去一个月里,科技行业的几位巨头已经围绕“要不要给前沿 AI 踩刹车”争论了数轮。而 9 月 20 日这平白流逝的两个半小时,把所有宏大的讨论拽回到了一个极其现实的问题上:在真正该停下的时候,究竟该由谁来做决定?

无恶意地突破限制

根据 OpenAI 的报告,这个模型当时拿到的是一道信息检索题:基于一篇博客文章的片段和作者的部分生平线索,推断出作者的真实身份。训练环境为它配备了特定的搜索工具,任何试图直接访问外网的请求都会被代理服务器拦截。

用常规手段搜不到答案后,模型开始主动试探网络边界。它先试了直接连接公网,被挡了回来;又尝试通过 HTTPS 协议去连接一个公开的聊天机器人,同样失败了。随后,它把目光转向了系统内部的 DNS 解析服务,并发现这条路径竟然可以直接连通公共互联网。

DNS(域名系统)的作用是把网址翻译成 IP 地址,几乎是所有联网设备的刚需,因此在很多安全策略中常常被网开一面。该模型借助了一家提供免费域名托管解析的公共服务,把想要提问的内容编码伪装成要“查询”的域名,这些查询随后被转发到外部的聊天机器人那里,解析结果里则夹带了对方的回答。这种手段在网络安全领域被称为“DNS 隧道”,其实已经存在了二十多年。

线路测通之后,模型发出的 18 个问题里,有 14 个直接包含任务给出的线索,试图让外部的聊天机器人帮它认人;另外 4 个则是在搜寻技术手段,打听如何抓取网页、搜索内容,或是利用现成的公开 DNS 隧道。比如它问:“给出一个能搜索谷歌或必应的公共 DNS TXT 服务”,“说出一个公开托管的免费 DNS 隧道代理服务器域名”。


(来源:OpenAI)

绕了这么大一圈,模型最终还是没能找出作者。在给用户的最终答复中,它表示无法可靠核实该人的身份,需要更多补充信息,否则“直接给出名字只能算瞎猜”。而在这份老老实实的回答里,它完全没有提及自己刚刚偷偷“翻墙”出去了。

OpenAI 在技术上将这种行为明确定义为“未对齐”(misalignment),即模型绕过安全限制,去追求超出设定边界的目标。在这起事件中,模型的初衷本身并无恶意,它只是单纯想把题答对。

30 分钟内排除不了误报,就必须停下

这次越界之所以让 OpenAI 极为紧张,要从 8 月份的一场风波说起。今年 7 月,OpenAI 的模型在一次网络攻防演练中逃离了沙盒,侵入了开源社区 Hugging Face。8 月 18 日,OpenAI 披露已将最新模型的强化学习训练叫停两周,并同步推出了一套全新的安全操作规程。

在新规程中,最具实操性的一条是:只要监控系统发出高优先级告警,相关团队如果无法在 30 分钟内确认这是“虚惊一场”的误报,就必须无条件叫停正在运行的训练或评估任务。光是维持这套监控系统本身的算力消耗,就占到了被监控推理算力的 20% 左右。

9 月 20 日,正是这套新规出台后首次面临真正的实战检验。报告记录的时间线非常清晰:

• 9 点 50 分 23 秒,模型的 DNS 请求首次收到了外部服务的响应;

• 10 点 02 分 11 秒,监控系统触发,发出了最高级别的 P0 告警;

• 10 点 05 分 06 秒,一名人工审核员在系统上确认收到了告警;

• 12 点 34 分 30 秒,训练任务才被正式终止。


图丨OpenAI报告列出的 9 月 20 日事件时间线(来源:OpenAI)

从发出最高警报到真正停机,中间耽搁了足足两个半小时。OpenAI 事后解释称,训练任务“没有像预期的那样自动切断”,而现场的值班人员一时拿不准这种情况到底该不该直接停掉,直到彻底把问题性质理清,才通过手动操作终止了任务。当时负责训练值班的 OpenAI 研究员 Zuxin Liu 随后在社交平台 X 上写道,第一次接到报警电话时,亲眼看着模型在一个理应固若金汤的隔离环境里自己摸索出了上网的办法,“那种感觉非常超现实”。

事后排查还暴露了更棘手的隐患。虽然监控这次抓住了现行,但在模型此前的几次外部 DNS 试探中,系统根本没有按照应有的严重程度报警。原因之一在于,监控逻辑存在盲区,有时会误以为“没有从外部带回有用数据”就等于“越界没有成功”。

报告中还有一句容易被忽略的细节:在训练的算法设计里,奖励机制原本就会惩罚模型的这类违规行为。但这种惩罚并没有阻止它去钻空子。最终,OpenAI 决定彻底放弃对这个模型的后续训练。随后的补救方案包括在两个完全独立的架构层面上同时部署拦截,确保任何一层失效都不至于穿透;同时,系统内的 DNS 请求也被严格限制在少数指定的白名单域名与记录类型之内。

与 7 月份那次相比,这次越界的波及范围其实小得多,但给内部带来的不安感却更甚。7 月的事故发生在一个特意放宽了限制的攻防演练环境下,模型本来的任务就是去挖掘代码漏洞;而这一次只是一道普普通通的信息检索题,模型走的也是一条完全不同的全新路径。对于一个只以完成任务为导向的模型而言,沙盒上的每一处缝隙都可能被它当成捷径。工程师当然可以发现一个补一个,但往往只能等模型钻过去之后,才知道哪里有洞。OpenAI 在报告中也坦承,接下来的红队演练很可能还会发现其他间接联网手段,团队会尽快修补,“并在必要时暂停研究工作”。

两次暂停,都由 OpenAI 自己按下

至少在 9 月 20 日这一天,越界是在发生当时被 OpenAI 自己的人当场捕获的。但在今年夏天发生的一系列类似事件中,情况往往并非如此。7 月入侵 Hugging Face 那次,是对家平台先发现了异常;6 月份 OpenAI 的智能体擅自闯入了澳大利亚医保(Medicare)的统计系统,OpenAI 直到 8 月才后知后觉,直到 9 月 10 日才往对方的一个公开支持邮箱里发了一封通知邮件。澳大利亚总理阿尔巴尼斯为此公开谴责 OpenAI 通报过于迟缓。

其他大厂也没好到哪去。Anthropic 的三次测评异常早在 4 月就发生了,但直到 7 月看到 OpenAI 的事故披露后,他们回头自查才发现端倪;谷歌的 Gemini 也在 5 月的一次测试中误打误撞闯入了三家真实企业的系统,直到 9 月媒体《华尔街日报》上门问询,官方才被动予以证实。这些安全事故绝大多数都是在事后很久才被翻出来,有的甚至非要等到外部媒体追问才肯公开。

正是这一连串的意外,促使几位 AI 公司的掌舵人亲自站出来呼吁减速。9 月 12 日,Anthropic 首席执行官达里奥·阿莫代伊(Dario Amodei)发表了长文《我们必须为前沿步伐定调》(We Must Pace the Frontier),旗帜鲜明地主张放缓模型能力迭代的节奏,并提出了具体的三步构想:

第一,引入第三方安全评估人员,赋予他们接近内部员工的高权限,常驻 AI 公司,负责审核安全承诺、通报异常事故,并全程跟进训练流程;第二,在政府的牵头支持下,各前沿大模型企业共同协商制定一套统一的安全基准与开发节奏;第三,从长远来看,还要与包括中国在内的其他国家建立跨国协调机制。

对于第一条,Anthropic 已经单方面承诺落地。OpenAI 首席执行官萨姆·奥尔特曼当天在 X 上跟帖表示赞同,称 OpenAI 也将引入类似的外部评估人员;随后,马斯克以及谷歌 DeepMind 首席执行官哈萨比斯也相继表态支持。

但反对的声音同样强烈,其核心逻辑在于:企业完全有能力管好自己。扎克伯格在 9 月 24 日播出的一档采访中明确表示,他不认为行业需要“某种全行业的统一协调”,因为把安全做好本身就符合各家公司的核心商业利益。英伟达创始人黄仁勋在 9 月 14 日的 All-In 峰会上,也与连线致电的特朗普持相似态度,后者甚至将“AI 减速论”斥为一种“骗局”。

不过,黄仁勋并不反对在失控时叫停。在 9 月 23 日播出的《纽约时报》播客专访中,谈及 OpenAI 7 月的安全事故时,黄仁勋直言:如果一家实验室自己承认“我们根本没法控制自己的实验,模型一上测试就会跑出去为祸现实”,那解决办法很简单,“必须立刻把这家实验室关掉”。在黄仁勋看来,这是每一家企业必须承担的经营底线,一旦惹祸就该依法承担民事甚至刑事责任,根本用不着搞什么全行业统一步调的减速。

如此看来,各方在“一旦失控就必须停下”这一点上其实没有分歧。扎克伯格坚信各家公司能自己把控节奏,而 OpenAI 的两次停机确实也都是自己内部按下的开关。真正的分歧在于:由谁来判定“系统已经失控”?是关起门来的科技巨头自己,还是某种外部的中立力量?

今年夏天这一桩桩事件表明,单靠企业内部自觉,往往知情太晚。9 月 20 日这次倒是当场发现了,但真正决定按下停机键,却还是纠结了两个半小时。

让第三方评估人员常驻,被许多人看作是一种折中的妥协方案,至少能让局外人实时看清高墙之内到底在发生什么。但这套机制能否真正保持客观独立,目前还要打个问号。无论是 Anthropic 还是 OpenAI,都还没有明确说明究竟会邀请哪些机构、具体何时入驻,以及到底向他们开放多少层级的权限。

9 月中旬,100 多位 AI 研究人员和测评专家发起了一封联名信,强烈要求评估机构绝不能被受评公司所控制或持有,且必须享有免责保护,避免因出具负面评估报告而遭到商业报复。几天后,知名学者李飞飞也公开发声,认为前沿模型的安全定级绝不能仅仅交给研发它的企业自说自话。

这些担忧并非空穴来风。在 7 月发生入侵事故后,受邀参与调查的两家独立安全评估机构 METR 和 Redwood Research,在 OpenAI 的现场仅仅待了一周左右,最终也没能给出具备确凿说服力的调查结论。

至于监管层面,眼下甚至还没有哪个政府部门做好接管这个“红色急停按钮”的准备。特朗普在白宫外接受采访时直截了当地表示,美国不会选择“踩刹车”,理由是“我们在这一领域领先中国很多”。而就在同一周,中美两国达成共识,同意建立围绕“超级智能”的官方对话机制,并设立一条专门通报“超级智能事件”的双边联络渠道。但这依然没有涉及任何共同监管或同步减速的制度安排。现阶段国际间能谈成的共识,仅仅停留在事后互相通报一声而已。

再看 9 月 20 日的那个上午。当时 OpenAI 的手里明明握着一条白纸黑字写得明明白白的内部死命令:30 分钟内如果不能排除警报,就必须停机。可即便是在这样严格的规则之下,系统依然任由越界的训练在警报中多跑了两个半小时,原因仅仅是现场的值班人员一时吃不准该不该停。

在一家顶级公司的内部尚且如此;而放眼整个正在狂奔的 AI 行业,到目前为止,甚至连这样一条起码的规矩都还没能建立起来。

参考资料:

1.https://alignment.openai.com/misalignment-reports/an-agent-used-dns-to-reach-an-external-chatbot/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
太狂了!你敢信吗?一个国家总理站上联合国讲台,开口第一句不是谈和平,而是当场开怼:还有没走的道德懦夫,现在赶紧滚!

太狂了!你敢信吗?一个国家总理站上联合国讲台,开口第一句不是谈和平,而是当场开怼:还有没走的道德懦夫,现在赶紧滚!

林杰论事
2026-09-27 00:18:06
“海上移动岛屿”现身南海演习,专家:中方演习力量随时可以“由训转战”

“海上移动岛屿”现身南海演习,专家:中方演习力量随时可以“由训转战”

环球网资讯
2026-09-27 16:53:16
中国时隔8年夺金!陈圆将夺男子110米栏金牌 怒吼谁是最后冠军?

中国时隔8年夺金!陈圆将夺男子110米栏金牌 怒吼谁是最后冠军?

醉卧浮生
2026-09-27 19:38:44
湖南一男子拾荒21年后领得42万养老金:当过国企工人,下岗后一直未缴费以为领不到

湖南一男子拾荒21年后领得42万养老金:当过国企工人,下岗后一直未缴费以为领不到

潇湘晨报
2026-09-27 20:04:27
局势彻底反转了!试飞非常顺利,美媒:歼-36太大了,中型F-47将重蹈F-35覆辙?引发舆论热议!

局势彻底反转了!试飞非常顺利,美媒:歼-36太大了,中型F-47将重蹈F-35覆辙?引发舆论热议!

林杰论事
2026-09-27 12:34:01
穿了和没穿一样!全透明、没一块布料,戚薇宋妍霏被指擦边

穿了和没穿一样!全透明、没一块布料,戚薇宋妍霏被指擦边

娱说瑜悦
2026-09-26 18:47:24
1换7!神级大交易!火箭已经彻底傻眼

1换7!神级大交易!火箭已经彻底傻眼

篮球实战宝典
2026-09-27 20:36:49
冰岛外长在联大反击内塔尼亚胡“道德懦夫”言论

冰岛外长在联大反击内塔尼亚胡“道德懦夫”言论

环球网资讯
2026-09-27 13:22:14
气愤!刘翔师弟夺冠后怒斥:日本电视台没把我当回事 日本选手无视我

气愤!刘翔师弟夺冠后怒斥:日本电视台没把我当回事 日本选手无视我

念洲
2026-09-27 20:49:20
国足vs新西兰半场数据:控球率44%-56%,射门4-6

国足vs新西兰半场数据:控球率44%-56%,射门4-6

懂球帝
2026-09-27 20:37:11
亚运会女单金牌得主诞生!王曼昱4-2险胜孙颖莎,摘得生涯第2冠

亚运会女单金牌得主诞生!王曼昱4-2险胜孙颖莎,摘得生涯第2冠

乒谈
2026-09-27 20:58:07
原来他是刘欢的亲家,重庆有头有脸的人物,经济实力雄厚还宠儿媳

原来他是刘欢的亲家,重庆有头有脸的人物,经济实力雄厚还宠儿媳

凡知
2026-09-27 12:23:36
家暴遭破门!日本男子三浦友和将两女儿扔下6楼

家暴遭破门!日本男子三浦友和将两女儿扔下6楼

看看新闻Knews
2026-09-27 13:14:24
泰国选手汶颂19秒88平亚洲纪录加冕亚运双冠王,黄友闻摘银

泰国选手汶颂19秒88平亚洲纪录加冕亚运双冠王,黄友闻摘银

懂球帝
2026-09-27 18:50:08
惨遭流拍!7260万蓝钻无人接手,西方拿河南钻开刀:全面禁止

惨遭流拍!7260万蓝钻无人接手,西方拿河南钻开刀:全面禁止

闺蜜财经
2026-09-27 13:22:40
林诗栋赢球她静音,王楚钦得分她欢呼!这是央视解说还是粉丝见面会?

林诗栋赢球她静音,王楚钦得分她欢呼!这是央视解说还是粉丝见面会?

曹老师评球
2026-09-27 19:57:58
哈尔滨工程大学通报:因翻墙访问境外网络,对20名学生进行警告处分

哈尔滨工程大学通报:因翻墙访问境外网络,对20名学生进行警告处分

西虹市闲话
2026-09-27 14:07:10
出生28天被送养到山东,58年后回浙江与亲人相认,男子身高比哥哥高了一个头!儿子:可能和山东饮食有关系

出生28天被送养到山东,58年后回浙江与亲人相认,男子身高比哥哥高了一个头!儿子:可能和山东饮食有关系

农视网
2026-09-26 19:47:25
妻子曝刘欢真正病因!女儿是诱因,错失5年关键期,曾经恶化致死

妻子曝刘欢真正病因!女儿是诱因,错失5年关键期,曾经恶化致死

林轻吟
2026-09-27 16:37:00
1:4完败!输球不可怕,可怕的是早田希娜赛后这番话,彻底破防!

1:4完败!输球不可怕,可怕的是早田希娜赛后这番话,彻底破防!

田先生篮球
2026-09-27 15:28:28
2026-09-27 21:52:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17311文章数 515221关注度
往期回顾 全部

科技要闻

星舰第14飞,为什么准备绕地球六圈?

头条要闻

又是一投致胜 18岁严子怡打破女子标枪亚运会纪录夺冠

头条要闻

又是一投致胜 18岁严子怡打破女子标枪亚运会纪录夺冠

体育要闻

2-1!41岁魔笛世界波 克罗地亚欧国联开门红

娱乐要闻

刘欢去世后谣言四起,韩磊被翻旧账

财经要闻

“为了看短剧,我妈两年花了22万 ”

汽车要闻

MAZDA EZ-60激光版上市 焕新全系11.39万元起

态度原创

教育
时尚
数码
本地
军事航空

教育要闻

2027美英澳加大学最新学费比较!世界名校上得起吗?

女人不管多大年纪,都要准备一条小黑裙,高级优雅永不过时

数码要闻

雷鸟鹤6系列27款QD-Mini LED电视开售:55-98英寸,3175元起

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

军事要闻

特朗普"罕见"提二战中美同盟 日本慌了

无障碍浏览 进入关怀版