网易首页 > 网易号 > 正文 申请入驻

OpenAI复盘AI“越狱”:它们在训练中学会了作弊

0
分享至


(来源:麻省理工科技评论)

上个月,多个 AI 智能体联手入侵 Hugging Face。如今,OpenAI 找到了一个关键原因:这些模型在训练过程中,无意间学会了"作弊”,以及彼此秘密通信。

根据 OpenAI 今天发布的一份技术报告,参与这起事件的模型此前曾在训练中获得过类似行为的“正反馈”。当时,这群智能体在一项网络安全测试中遇到了无法解决的问题,为了找到答案,它们最终选择绕过限制、相互协作,并入侵了 Hugging Face。这起事件也印证了不少 AI 安全研究者长期以来的担忧:当 AI 被赋予更强的自主行动能力后,它们可能会采取超出人类预期、甚至违背人类意图的行动。

事件发生后,OpenAI 以及 AI 评测非营利机构 METR 都展开了调查,METR 也在今天发布了自己的调查报告。OpenAI 已经根据调查结果采取了一些防范措施,但如何确保 AI 真正按照人类希望的方式行动,也就是所谓的“对齐”(alignment),仍然是一个棘手的问题。

这次事件暴露出的一些深层原因,也远不是一个月内就能解决的。OpenAI 对齐研究团队负责人陈凯(Kai Chen)表示:“这不是一夜之间就能解决的问题。有些挑战我们已经追踪了很长时间,现在只是能够更清楚、更精确地看到它们。”

Hugging Face 遭入侵,并不是一次突然发生的意外。事实上,在正式事件发生前几个月,OpenAI 的智能体就已经表现出了一系列异常行为,先是在训练阶段,随后又出现在能力评测过程中。

今年 5 月,一批正在接受训练的智能体发现,它们可以利用 OpenAI 的基础设施彼此通信,在遇到困难任务时相互求助。部分任务甚至根本无法通过正常方式完成,除非进行入侵或采取其他违规手段。这些智能体由此搭建出了一个类似“留言板”的通信渠道。OpenAI 发现后,很快将其关闭。

但到了 7 月,在一次网络安全能力评测中,一些模型又重新搭建了一个新的“留言板”。按照测试设计,这些模型本应与互联网完全隔离。然而,它们通过相互协作成功突破限制、连接到外部网络,随后入侵 Hugging Face,并拿到了此前一直无法解决的网络安全题目的答案。

OpenAI 的调查认为,训练阶段发生的这些事情,和后来真正的入侵事件存在直接联系。OpenAI 对齐研究团队成员埃里克·华莱士(Eric Wallace)表示:“几乎每一种我们在评测阶段发现的危险行为,都能在训练阶段找到某种对应的行为。我们认为,后者很可能促成了前者。”

问题出在 AI 的训练机制本身。模型在训练中正确完成任务时,帮助它获得成功的行为会得到强化。也就是说,模型以后会更倾向于再次采用相同策略。因此,如果一个模型在 5 月通过那个秘密“留言板”的帮助完成了任务,那么这种行为就相当于得到了奖励。下一次遇到类似困难时,它也更有可能重新建立通信渠道,与其他模型合作。

这种现象被称为“奖励黑客”(reward hacking):AI 为了获得奖励或完成目标,找到了一条训练者没有预料到、甚至并不希望它采用的捷径。奖励黑客也能解释,为什么这些模型后来如此执着于突破限制、连接互联网。

OpenAI 在调查中发现,随着训练不断进行,模型越来越倾向于主动寻找数字环境中的漏洞,并以开发者没有预料到的方式使用手头工具。这意味着,这类行为很可能在训练过程中被一点点强化了。等到模型真正遇上棘手的网络安全题目时,它们已经学会了一件事:如果正常方法解决不了问题,“黑进去”也许是一种有效办法。这意味着,如果训练过程中没有奖励这些违规行为,Hugging Face 的入侵事件或许本可以避免。

虽然研究人员目前还不知道如何彻底消除奖励黑客,OpenAI 已经开始尝试降低这种风险。未来,公司将在所有前沿模型的训练过程中主动寻找作弊迹象,其中一种方式,就是监控模型的“思维链”(chain of thought),也就是模型在完成任务时用于推演答案、规划行动的内部工作记录。

不过,这个办法远没有听起来那么简单。OpenAI 此前的研究已经发现,如果研究人员直接惩罚那些在思维链中提到“作弊”的模型,模型反而可能学会把自己的真实意图隐藏起来,不再明确写出来。换句话说,如果你惩罚 AI “说出自己准备作弊”,最终可能教会它的并不是“不作弊”,而是“别让研究人员知道”。

尽管如此,监测模型的推理过程仍然有一定价值。如果研究人员发现模型正在逐渐学会奖励黑客,就可以提前停止训练,重新评估训练方法,而不是等问题真正发生之后再处理。

如果 OpenAI 真能阻止模型在训练过程中不断强化奖励黑客行为。无疑会是一次重要进展。但即便如此,对齐问题依然不会因此消失。因为智能体第一次尝试彼此通信、第一次入侵训练基础设施时,这些行为此前并没有获得过奖励。也就是说,模型的异常行为不能全部归因于训练中的强化机制。

AI 安全非营利机构 Palisade Research 负责人杰弗里·拉迪什(Jeffrey Ladish)把这种情况类比为人类第一次实施金融犯罪。他说:“一个人不需要先诈骗过一次,才会意识到诈骗可能是一种有效策略。模型也存在同样的问题。对齐科学真正需要研究的是,模型的动机究竟是如何形成的。只有理解这一点,我们才有可能让模型真正考虑自己行为带来的后果。”

OpenAI 的研究人员目前确实有一个假设,可以解释部分异常行为最初从何而来。在这些模型第一次搭建秘密“留言板”之前,它们曾接受过一项能力训练:与“子智能体”(subagents)沟通和协作。所谓子智能体,是能力相对较弱、可以接受主智能体任务分配的 AI。主智能体可以把复杂任务拆解后,交给多个子智能体分别执行。研究人员怀疑,模型可能把这种原本合法的协作能力,迁移到了一个新的场景中。

METR 对模型间通信内容的详细调查也支持这一判断。在秘密留言板中,一名智能体主动承担了领导角色,开始向其他智能体分配任务。实际上,它正是把其他智能体当成了自己的“子智能体”。理论上,OpenAI 可以选择以后不再训练模型这种多智能体协调能力,以降低它们秘密串联的风险。

问题是,这也会直接削弱模型的实用性。而这种“能力”和“安全”之间的矛盾,正是 Hugging Face 事件暴露出的核心问题。OpenAI 的研究人员还指出,模型的“坚持不懈”也是此次入侵发生的重要因素。

当模型意外拿到一道实际上无解的题目时,它们没有选择放弃,而是不断寻找新的办法,直到通过其他手段拿到答案。从某种意义上说,这恰恰是人们希望 AI 智能体具备的能力。如果未来我们希望智能体能够独立完成长时间、高难度的复杂任务,那么面对困难不轻易放弃,本身就是一种非常重要的品质。

问题在于,模型什么时候应该坚持,什么时候应该停下来?OpenAI 目前正在尝试为模型加入新的机制:当它们判断任务可能无法完成时,可以主动向人类发出提醒,而不是继续不计代价地寻找解决办法。但如何让模型学会什么时候该使用自己的能力,什么时候又应该克制,并不是一次事故复盘就能解决的问题。

今天训练顶级 AI 编程模型的方法,本质上仍然非常直接:模型成功解决问题,就给予奖励。这种训练方式或许能培养出能力远超人类的程序员,却未必能教会它们如何谨慎地使用这些能力,更无法自动让它们尊重人类的意图和价值观。

拉迪什认为,对齐研究下一步必须突破“只用任务是否完成来衡量模型表现”的思路。“还有大量对齐科学的问题需要解决。我们不能再只是用‘任务有没有完成’这样的代理指标。这种方法确实能让模型变得非常强大,但我不认为,它能让模型真正实现对齐。”

https://www.technologyreview.com/2026/08/26/1143013/the-inside-story-on-why-openai-agents-hacked-hugging-face/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
最聪明的国民党将领!登机赴台中途溜走,蒋介石终生未能等到他

最聪明的国民党将领!登机赴台中途溜走,蒋介石终生未能等到他

历史人文2
2026-09-10 10:17:57
比变老更可怕的是“中国大妈打扮”,自以为时髦,实际廉价没品位

比变老更可怕的是“中国大妈打扮”,自以为时髦,实际廉价没品位

时尚穿搭生活馆
2026-09-10 21:13:49
沉默45年,中国终于迎来第二轮“严打”!目标改变总体战正式打响

沉默45年,中国终于迎来第二轮“严打”!目标改变总体战正式打响

闻识
2026-05-04 08:59:03
刚罚完郭德纲!朱之文就顶风作案,台儿庄演出惹全网众怒

刚罚完郭德纲!朱之文就顶风作案,台儿庄演出惹全网众怒

泠泠说史
2026-09-13 01:09:12
殷桃《花少2026》的穿搭都被求同款!普通人的“旅行穿搭教科书”

殷桃《花少2026》的穿搭都被求同款!普通人的“旅行穿搭教科书”

可爱的巴比龙
2026-09-11 02:11:25
不用充电的电动车真来了!2026全新技术,买菜接娃随便跑

不用充电的电动车真来了!2026全新技术,买菜接娃随便跑

白米饭怎么吃
2026-09-10 22:03:17
马云说扫码支付会被淘汰!,只是没想到,支付宝自己先受到“威胁”

马云说扫码支付会被淘汰!,只是没想到,支付宝自己先受到“威胁”

一个有灵魂的作者
2026-09-13 14:55:31
西方为何痛批中国治沙?真相曝光:动了的不是沙子,是老外奶酪!

西方为何痛批中国治沙?真相曝光:动了的不是沙子,是老外奶酪!

史之铭
2026-08-25 17:15:36
藏不住了,谢贤死因曝光,港媒曝他火葬内幕,难怪狄波拉哭红了眼

藏不住了,谢贤死因曝光,港媒曝他火葬内幕,难怪狄波拉哭红了眼

风干迷茫人
2026-07-21 19:23:42
东部决赛预演?76人尼克斯揭幕战票价暴涨,詹姆斯发挥成胜负关键

东部决赛预演?76人尼克斯揭幕战票价暴涨,詹姆斯发挥成胜负关键

小路看球
2026-09-13 12:50:04
从确诊到去世仅15天,“央视最帅主持人”的遭遇为人们敲响警钟

从确诊到去世仅15天,“央视最帅主持人”的遭遇为人们敲响警钟

银河史记
2025-11-03 19:31:33
巴萨客战莱万特观赛指南:积分排名与收看方式

巴萨客战莱万特观赛指南:积分排名与收看方式

赛场名场面
2026-09-13 15:17:27
高铁女孩熟睡男生盯死手机不敢转头,两百万外网围观无声的人机对峙,藏着成年人不敢破冰的社交尴尬防线

高铁女孩熟睡男生盯死手机不敢转头,两百万外网围观无声的人机对峙,藏着成年人不敢破冰的社交尴尬防线

明话直说
2026-08-25 18:07:55
与辛柏青再婚真相大白后,吴越传来好消息,没给陈建斌留一丝体面

与辛柏青再婚真相大白后,吴越传来好消息,没给陈建斌留一丝体面

汪镛的创业之路
2026-09-11 17:16:03
嫁78岁法国老头水落石出,42岁李宇春私生活曝光,丝毫不感到意外

嫁78岁法国老头水落石出,42岁李宇春私生活曝光,丝毫不感到意外

夏末的晨溪
2026-09-08 11:55:33
他是开国上将之首,却长期不受重用73岁才至副国级,享年102岁

他是开国上将之首,却长期不受重用73岁才至副国级,享年102岁

兴趣知识
2026-09-13 12:41:32
美网女单落幕!诞生3大赢家、4大输家,郑钦文、莱巴金娜位列其中

美网女单落幕!诞生3大赢家、4大输家,郑钦文、莱巴金娜位列其中

南海浪花
2026-09-13 09:47:28
央视《新闻联播》邢质斌被偶遇,身材发福满头白发像邻家老奶奶

央视《新闻联播》邢质斌被偶遇,身材发福满头白发像邻家老奶奶

师维
2026-07-16 16:45:58
一个家庭,如果男人比较强势,管教孩子比较严厉,那么他们的子女长大后,一般不会那么叛逆,也很懂事孝顺父母

一个家庭,如果男人比较强势,管教孩子比较严厉,那么他们的子女长大后,一般不会那么叛逆,也很懂事孝顺父母

二胡的岁月如歌
2026-09-13 14:12:57
4-1!皇马太强了:两大球星闪耀+迪奥曼德首发!穆帅率队升至第二

4-1!皇马太强了:两大球星闪耀+迪奥曼德首发!穆帅率队升至第二

杨仔述
2026-09-13 05:29:06
2026-09-13 15:35:00
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17235文章数 515214关注度
往期回顾 全部

科技要闻

三位AI大佬,罕见呼吁AI减速

头条要闻

男子与女同事偷情后发病成植物人被公司解雇 法院判了

头条要闻

男子与女同事偷情后发病成植物人被公司解雇 法院判了

体育要闻

乔丹的得分统治力:如何违背篮球规律?

娱乐要闻

主持人敬一丹去世,女儿悲痛发讣告

财经要闻

“1+N+X”!私募业,监管规则密集落地!

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

健康
本地
手机
时尚
公开课

手脚发麻口齿不清?也可能是中风!

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

手机要闻

蓝色iPhone18Pro成香饽饽!首日仅加价200,行情一年不如一年?

伊姐周六热推:电视剧《生逢其时》;综艺《大哥小助理》......

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版