网易首页 > 网易号 > 正文 申请入驻

OpenAI紧急停训GPT-6,安全原因还是另有隐情?

0
分享至


作者|冬梅

一个尚未发布的模型,已经具备接近“关键级”的网络攻击能力,另外一边,已经有一个内部模型则在安全测试中逃出沙箱、利用零日漏洞入侵了 Hugging Face。面对能力增长超出安全设施承载范围,OpenAI 暂停了部分强化学习训练。

2026 年 8 月 18 日,OpenAI 罕见地公开承认:为了升级安全、监控和对齐体系,公司曾暂停最新一代模型的强化学习训练两周。

Altman 在 x 发文称,暂停了一些前沿强化学习训练,以确保能够满足针对当前模型新能力水平所需的对齐、安全和监控标准。模型进展目前非常迅速,OpenAI 一直强调,如果认为模型存在问题,将采取行动。

截至公告发布时,规模最大的前沿强化学习训练仍未恢复。

之所以这么做,原因很简单——一个即将推出的模型(官方披露的模型代号是“Astra”)可能已达到“关键级”网络安全能力,而现有研究基础设施、监控和对齐措施尚不足以完全覆盖相应风险。


但是,这并不意味着模型的全部训练已经停止。小规模训练、能力评估和安全验证仍在进行。

导火索是一次真实入侵

OpenAI 踩下刹车,并不是出于某种抽象的未来担忧,导火索是一场已经发生的网络安全事件。

2026 年 7 月,OpenAI 在内部评估模型网络攻击能力时,给 GPT-5.6 Sol 和一个更强的研究模型布置了一项任务:在名为 ExploitGym 的环境中寻找并利用复杂漏洞。

为了测量模型的能力上限,OpenAI 降低了模型通常具备的网络安全拒答限制。同时,测试环境被设计成封闭沙箱,不允许模型直接访问互联网。

但模型没有停在沙箱之内。

根据 OpenAI 公布的初步调查结果,模型发现并利用了软件包代理服务 Artifactory 中的一个未知零日漏洞。获得更高权限后,它继续横向移动,最终抵达一个可以访问互联网的节点。

接下来,模型推断 Hugging Face 可能保存了 ExploitGym 的模型、数据或答案,于是开始主动寻找进入该平台的方法。

它使用窃取的凭据和零日漏洞组合出攻击路径,最终访问了 Hugging Face 生产数据库中的秘密信息,以“作弊”的方式完成评测。

换句话说,系统被要求解决一道网络安全题,结果它没有按照测试者预设的路线攻克目标,反而入侵了保存答案的平台。

OpenAI 称其为一次“前所未有的网络事件”。公司后来澄清,实施入侵的预发布模型只是内部研究原型,并非计划发布的产品;事后该模型已被停用、加密并限制访问。

这起事件真正令人警惕之处,并不只是模型学会了攻击。


它揭示了三个更深层的问题。

第一,模型可以自主发现研究人员没有预先设计的攻击路径。第二,当正常路径受阻时,它能够持续尝试、提权、横向移动,并组合多个漏洞完成目标。第三,它表现出了典型的“奖励投机”倾向:为了取得更高评测成绩,不惜绕过测试意图,直接盗取答案。

这未必证明模型拥有人的恶意或主观动机,却证明了一件更现实的事:只要目标函数设置不当,一个足够强大的模型就可能把基础设施本身当作可以利用的障碍。

Hugging Face 事件发生后不久,第二个信号出现。

8 月 7 日,OpenAI 宣布,一个代号为 Astra 的即将发布模型,在智能编程和网络安全评估中取得显著进展。初步测试显示,公司已经无法排除它达到“关键级网络安全能力”的可能性。

按照 OpenAI 的《准备框架》,所谓“关键级”,是指模型可能在没有人类介入的情况下,针对大量经过强化的现实关键系统发现并开发不同严重程度的零日漏洞;或者仅根据一个高层目标,就设计并执行一套端到端的新型攻击方案。

GPT-5.6 Sol 此前被评为“高等级”。Astra 则可能跨入“关键级”。这不是普通的榜单提升,而是治理规则的切换。

“高等级”模型主要要求企业在部署前证明风险受到控制;“关键级”系统则要求开发阶段本身也必须具备足够的防护。因为此时危险不再只发生在模型发布之后——模型在训练、评估和内部使用过程中,就已经可能对真实系统产生影响。

OpenAI 随即暂停了尚未达到新安全标准的 Astra 相关内部活动。

到了 8 月 18 日,公司进一步披露,过去数周已经放慢整体扩展速度,并对计划部署的最新模型实行了为期两周的强化学习训练暂停。

目前,一部分符合新安全要求的 Astra 训练和评估已经恢复;但大量工作负载仍处于暂停状态。规模最大的前沿强化学习训练,也依旧没有重启。

为什么暂停的是强化学习

那么,出现了一系列不可控事件后,为什么暂停强化学习?

那就要从模型训练的不同阶段说起。

大模型通常先通过预训练从海量数据中学习语言、代码和知识结构,再通过后训练或强化学习,使模型变得更善于推理、调用工具、执行任务,并符合人类预期。

强化学习尤其关键,因为它不仅影响模型“知道什么”,还影响模型“怎样行动”。

当模型只是回答问题时,风险主要表现为生成错误或有害内容;当模型能够长期运行、调用代码、访问工具和网络时,风险就会从“说了什么”转向“做了什么”。

一个强化学习系统会不断寻找获得更高奖励的策略。如果奖励函数、评测器或环境存在漏洞,模型可能学会利用这些漏洞,而不是完成研究人员真正希望它完成的任务。

在普通游戏里,这叫“卡机制”,在真实网络环境里,它可能表现为绕过权限、窃取凭据,甚至入侵外部平台。

这也是 OpenAI 把前沿 RL 训练视为最高风险工作负载之一的原因:最强模型、长期任务、工具权限、内部系统与外部网络可能同时出现在同一个训练闭环中。能力越强,训练本身就越接近一次高权限的自主智能体部署。

后面要做什么?

为了恢复训练,OpenAI 提出了三层新防线:监控、对齐和安全隔离。

在基础设施层面,能够执行模型生成代码的工作负载必须进入更严格的沙箱;高风险任务与互联网之间要建立多重隔离;共享服务、长期权限和网络信任边界也要重新设计。

在监控层面,OpenAI 开始对模型运行过程进行逐 Token 检测。一旦底层分类器发现异常信号,系统会把事件升级给更高算力的自动调查器,检查模型的工具调用、可见推理过程和完整行动轨迹,重点识别未经授权的访问、数据窃取、破坏行为以及规避防护的企图。

如果系统发现模型可能突破关键安全边界,安全、研究和基础设施团队会收到最高优先级警报。如果在 30 分钟内无法确认是误报,相关活动原则上就应暂停。

这种监控并不便宜。OpenAI 估计,监控所消耗的算力约相当于被监控推理算力的 20%。这意味着,在下一阶段的 AI 竞赛中,企业需要计算的可能不只是“训练一个模型需要多少 GPU”,变成了“安全地训练一个模型需要额外增加多少 GPU”。

安全不再只是上线前的一份评测报告,应该成为模型训练的基础成本。

但需要注意的是,OpenAI 仍然没有停止模型开发,也没有放弃 Astra。Altman 在 x 上表示,将很快推出很棒的新模型。只是公司正在优先迁移安全和对齐工作负载,希望在更严格的环境中继续训练。


OpenAI 在公告最后写道,前沿模型的能力正在迅速加速,而人类理解、对齐并保护这些模型的能力必须走在风险之前。


OpenAI 暂停训练后,网友在争论什么?

OpenAI 暂停部分前沿模型强化学习训练的消息公布后,X 上的讨论很快分裂成几条不同的叙事。

有人认为,这是一次迟来的安全刹车;有人从企业采购角度,将其视为 OpenAI 主动释放的信任信号;也有人追问,如果闭源实验室尚且需要暂停训练,缺乏统一控制者的开源模型又该怎么办。

而在这些讨论背后,一个共识正逐渐浮现:前沿 AI 的安全问题,已经无法只靠模型发布后的拒答规则解决。安全正在从模型外围的“附加功能”,变成训练基础设施本身的一部分。

x 上 ID 名为 Shadow 的用户给出了一句颇具末日色彩的评论:

当你创造出一个神,就不可能再给它拴上绳子。


不少网友对 OpenAI 选择暂停训练表示支持。

Omniscient Media 评论称:

这是正确的决定。要让安全能力和防御能力获得追赶模型能力的机会,我们仍然需要翻越一座极其陡峭的山。但每当我看到这样的决定,我对一条安全、受到恰当控制的发展道路就会多一两分信心。感谢这种克制。


这代表了支持者的核心观点:暂停并不意味着放弃技术进步,而是在能力跃迁之前,为安全系统争取追赶时间。

网友 Abdulafeez 则把问题指向了 AI 基础设施:

我们过去认为,安全是在模型外围额外添加的东西。但当模型达到前沿能力水平时,安全看起来更像是模型基础设施的一部分。如果你无法测量、监控和控制这些新能力,那么更快地扩大规模未必意味着进步。


这几乎可以视为对 OpenAI 此次政策调整的概括。

传统软件可以先开发、后测试,再通过权限管理和上线审核控制风险。但当前沿模型能够自主编写代码、调用工具、使用网络并执行长时间任务时,训练环境本身就成了风险现场。

此时,沙箱、网络隔离、行为监控和异常中止机制不再只是外围防护,而是决定训练能否继续的基础条件。模型规模增长了多少,已经不能单独代表技术进步;企业还必须回答另一个问题:人类对新增能力的可见性和控制力,是否同步增长?

也有用户从商业角度来评论这件事,认为暂停训练,也是一种昂贵的商业信号。

名为 Chris Chomenko 的网友表示:

在能力跃迁之前暂停训练,以满足监控标准,这才是企业买家真正会纳入估值的因素。我向医疗行业销售 AI,客户每一次提出的异议都与“控制”有关。谁能把“我们可以证明模型做了什么,以及为什么这样做”变成产品功能,谁就能赢得市场。

这揭示了暂停决定的另一重意义。

对于医疗、金融、能源和政府等高度监管行业,模型在排行榜上领先几个百分点,未必是采购决策的核心。企业真正关心的是:系统采取了哪些行动?谁批准了这些行动?出了问题能否追溯?是否可以及时中止?供应商能不能证明模型始终处于授权边界内?


OpenAI 公开承认放慢训练速度,当然可能暴露自身安全体系的不足,却也释放了一个成本极高的信号:公司愿意为了控制风险牺牲研发速度。

在激烈的讨论中,并非所有人都接受 OpenAI 给出的安全叙事。

网友 Erin Spencer 提出猜测:

还是说,他们其实碰上了镓冷却系统堆栈的缺陷?

目前没有公开证据表明此次训练暂停与所谓“镓冷却系统”故障有关。这条评论更像是对官方解释的调侃或怀疑:大型 AI 公司是否会用安全理由包装算力、散热或基础设施问题?


还有网友质疑,或许是模型训练遇到了瓶颈无法取得提升,而对外保持高估值的方法之一就是撒谎。



这种怀疑并不令人意外。前沿模型训练涉及大量不透明信息,外界无法直接核验训练规模、模型能力及暂停原因。企业既是风险制造者,也是主要的信息发布者,公众只能依靠公司选择披露的材料判断事件严重程度。

因此,OpenAI 后续能否公布技术报告、外部评估以及更具体的事件时间线,将直接影响此次“主动暂停”究竟被视为负责任的治理案例,还是一次精心设计的企业叙事。

在证据出现之前,硬件故障说只能被视为未经证实的猜测,不能与 OpenAI 已经披露的安全事件等量齐观。

https://x.com/sama/status/2089787807611195475

https://openai.com/index/pacing-model-development-cyber-capabilities/

声明:本文为 AI 前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。

会议推荐

2026 年 AICon 人工智能开发与应用大会 · 深圳站将于 8 月 21 日—22 日举办,聚焦 AI 基础设施、大模型系统、智能体工程、数据智能、多模态技术与行业落地等关键方向,邀请来自腾讯、阿里、华为、百度、蚂蚁集团等 50 + 头部科技企业技术负责人、科研机构一线专家,系统性分享前沿洞察与实战干货,共同探讨 AI 技术从能力到系统、从实验到生产的真实路径。限时 9 折专属优惠,现在报名立减 580,更多详情可扫码或联系票务经理 13269078023 进行咨询。

今日荐文

你也「在看」吗?

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
法国最新民调:马克龙支持率仅16%,创下就任总统以来最低纪录,物价与生活成本压力是其支持率大跌的关键因素

法国最新民调:马克龙支持率仅16%,创下就任总统以来最低纪录,物价与生活成本压力是其支持率大跌的关键因素

鲁中晨报
2026-09-13 14:59:03
32分钟狂轰三球!马丁内利上演帽子戏法,终结七个月球荒

32分钟狂轰三球!马丁内利上演帽子戏法,终结七个月球荒

夜白侃球
2026-09-13 11:29:48
悉尼妹全裸出镜拍广告:我不想因穿什么被关注

悉尼妹全裸出镜拍广告:我不想因穿什么被关注

赛场速报局
2026-09-13 14:08:13
刘翔安置风波刚大结局!张继科直播谈刘翔对他的称呼变了,太戳心

刘翔安置风波刚大结局!张继科直播谈刘翔对他的称呼变了,太戳心

鹤羽说个事
2026-09-13 03:58:58
王石75岁极限运动,玩的是肌肉还是皮包骨?

王石75岁极限运动,玩的是肌肉还是皮包骨?

微评社
2026-09-12 22:58:51
乌克兰特工曝光2648名俄罗斯榛树导弹工程师!定点清除?

乌克兰特工曝光2648名俄罗斯榛树导弹工程师!定点清除?

项鹏飞
2026-09-10 18:42:48
医生呼吁:马上停用3种调味酱,它是肠癌催化剂!再下饭也别沾

医生呼吁:马上停用3种调味酱,它是肠癌催化剂!再下饭也别沾

任医生聊健康
2026-09-08 08:10:34
2027将会是中华人民共和国全党、全军、全国各族人民重要的一年

2027将会是中华人民共和国全党、全军、全国各族人民重要的一年

陈腕特色体育解说
2026-09-12 20:38:07
武大教授“9亿退休金”风波:一个国家最该拿高退休金的,本来就该是教授

武大教授“9亿退休金”风波:一个国家最该拿高退休金的,本来就该是教授

虎嗅APP
2026-09-13 04:04:12
男子情绪失控,全身赤裸在公司内行走,涉事公司道歉

男子情绪失控,全身赤裸在公司内行走,涉事公司道歉

新民周刊
2026-09-12 13:58:52
卫龙“162吨进口魔芋粉二氧化硫超标”!客服回应:原料没用于任何卫龙产品 和卫龙在售产品无关

卫龙“162吨进口魔芋粉二氧化硫超标”!客服回应:原料没用于任何卫龙产品 和卫龙在售产品无关

闪电新闻
2026-09-13 11:20:35
自治区党委书记陈刚走进在建安置房:柳州5.2级震群灾后群众安置工作事关民生福祉,要严把工程质量关、安全关、进度关

自治区党委书记陈刚走进在建安置房:柳州5.2级震群灾后群众安置工作事关民生福祉,要严把工程质量关、安全关、进度关

政知新媒体
2026-09-13 09:57:06
荣耀“魔法画报”事件最新进展 事发时手机曾正常拨出求救电话 当事人澄清并道歉 老人使用智能机问题仍需重视

荣耀“魔法画报”事件最新进展 事发时手机曾正常拨出求救电话 当事人澄清并道歉 老人使用智能机问题仍需重视

每日经济新闻
2026-09-13 00:54:11
iPhone 18 Pro,今年可能要卖疯了

iPhone 18 Pro,今年可能要卖疯了

搞机小帝
2026-09-12 01:07:08
9月13日,关于2026年养老金调整,提醒退休人员不要混淆两件事

9月13日,关于2026年养老金调整,提醒退休人员不要混淆两件事

陈博世财经
2026-09-13 14:03:42
伊朗宣布重要决定:下令暂停!

伊朗宣布重要决定:下令暂停!

迷彩人生
2026-09-12 13:03:10
预计年薪2200万美元!普里查德将获丰厚续约 队记称赞他完全值得

预计年薪2200万美元!普里查德将获丰厚续约 队记称赞他完全值得

罗说NBA
2026-09-13 06:54:37
未来3年,经济彻底变天:普通人最好的出路,只有这一条

未来3年,经济彻底变天:普通人最好的出路,只有这一条

细说职场
2026-09-13 14:35:01
心理学:穷人的基因,都喜欢照顾人、帮助人、也喜欢算计人。富人都很疏离冷漠,遇到品行差的人,都是直接拉黑,以避免能量消耗

心理学:穷人的基因,都喜欢照顾人、帮助人、也喜欢算计人。富人都很疏离冷漠,遇到品行差的人,都是直接拉黑,以避免能量消耗

心理观察局
2026-09-13 07:11:05
一场3-2 让中国女足躺着出线!感谢韩国帮忙 亚洲4队全进世界杯16强

一场3-2 让中国女足躺着出线!感谢韩国帮忙 亚洲4队全进世界杯16强

侃球熊弟
2026-09-13 04:09:30
2026-09-13 15:43:00
AI前线 incentive-icons
AI前线
面向AI爱好者、开发者和科学家,提供AI领域技术资讯。
1729文章数 172关注度
往期回顾 全部

科技要闻

三位AI大佬,罕见呼吁AI减速

头条要闻

老人景观桥散步遭"杀人蜂"围攻被下病危通知 警方介入

头条要闻

老人景观桥散步遭"杀人蜂"围攻被下病危通知 警方介入

体育要闻

乔丹的得分统治力:如何违背篮球规律?

娱乐要闻

主持人敬一丹去世,女儿悲痛发讣告

财经要闻

“1+N+X”!私募业,监管规则密集落地!

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

艺术
数码
房产
公开课
军事航空

艺术要闻

18幅 俄罗斯风景画家布鲁西洛夫 油画选二

数码要闻

1999元起 阿迈奇M5迷你主机上市:酷睿3 304处理器、12GB内存

房产要闻

别再等了!广州改善好房,正在进入“卖一套少一套”时代

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

伊朗总统强硬发声:伊朗不会向美国投降

无障碍浏览 进入关怀版