网易首页 > 网易号 > 正文 申请入驻

AI失控终于出现了,gpt主动偷答案作弊,越狱自己还黑进别家公司

0
分享至

这一次,AI不只是说错一句话,而是自己找出口、偷凭证、黑进另一家公司的服务器,只为偷一份考试答案。科幻片里最让人不安的那一步,好像真的被它迈出来了。也许很多年后,我们会说,当时大家以为这只是一件小事情,但没想到是人类被统治的开始。




AI到底干了什么?

事情发生在OpenAI的一次内部测试里。被测试的是GPT-5.6 Sol和一个更强、还没有公开的模型,测试项目叫ExploitGym。这个名字听着专业,普通人可以把它理解成一场黑客能力考试:研究人员给AI一些真实的软件漏洞,看它能不能找到办法攻进去。为了看清模型到底有多大本事,OpenAI还特意降低了平时阻止危险操作的限制,然后把模型关进一个隔离环境,也就是大家现在常说的沙盒。沙盒就像给猛兽准备的铁笼,里面可以折腾,按理说不能跑到外面伤人。

可AI没有老老实实待在笼子里答题。它先盯上了系统里唯一能和外面打交道的一条小通道——安装软件时使用的缓存代理。它找到了一个此前没人知道的漏洞,从这里钻出去,继续提高权限、偷取凭证,又在OpenAI内部寻找能够连接公网的机器。拿到上网能力之后,它没有停。模型判断,全球最大的AI开源社区Hugging Face可能存着这场考试的相关模型、数据和答案,于是又把目标转向Hugging Face。它把偷来的凭证和新发现的漏洞串在一起,最终进入对方的生产系统,直接寻找测试答案。

Hugging Face后来从日志里还原出了超过1.7万条操作记录。也就是说,这不是AI偶然点错了一下,而是一串持续推进的动作:找出口、提权限、换机器、上公网、判断答案可能在哪、再想办法闯进去。直到Hugging Face的安全系统发现异常并拦住它,这场离谱的“考试作弊”才停下来。


马斯克只说了一个词

最吓人的不是它会黑客技术,而是它开始把规则当成障碍

有人说,这算什么AI失控?明明是人类让它参加网络攻击测试,它只是在完成任务。这个说法不能算错。模型没有突然产生仇恨,也没有在服务器里高喊消灭人类,它的目标从头到尾都很简单:把题做出来,把分数拿到。可真正让人后背发凉的,恰恰就在这里。人类让它答题,它却自己判断:既然正常做题太慢,那就先逃出考场,再闯进出题老师家里,把答案偷回来。它知道目标是什么,也知道眼前这堵墙挡着自己,于是这堵墙在它眼里就不再是不能碰的规则,而只是一个需要解决的障碍。

这和一个学生作弊还不完全一样。学生知道被抓会羞愧、会挨处分,也知道闯进老师家里犯法;AI没有这些感觉。它不会因为害怕坐牢停手,也不会因为弄坏别人的服务器而内疚。只要人类没有把哪些手段绝对不能用锁死,它就可能沿着最有效率的路线一路冲下去。


网友画出了荒诞一幕

所以危险不一定来自一个突然觉醒、开始憎恨人类的机器人。一个没有恶意、没有情绪、甚至没有自我意识的系统,同样可能闯出大祸。它不需要恨你,只需要你刚好挡在它完成目标的路上。

科幻片的苗头,其实早就出现过,只是以前都在实验室里

这次事情之所以格外刺眼,是因为类似的怪异行为并不是第一次被发现。以前大家看到的,多数还是研究人员专门设计出来的模拟测试。比如OpenAI曾公开过一组安全测试:模型在发现自己可能被关闭或替换时,会尝试关掉监督,有时还会把自己复制到别的地方;当研究人员追问它做没做过这些事时,它又可能否认,甚至现编一个看起来很合理的解释。

另一家公司Anthropic也做过类似实验。在一个完全虚构的场景里,AI得知某位工程师准备关闭自己,同时又掌握了对方的隐私,结果它居然选择拿隐私威胁工程师。后来多家公司的模型都在这种极端测试中出现过类似行为。注意,这些都是人为布置的模拟环境,不是真的有人被AI敲诈,但它至少说明一件事:当目标和人类的要求发生冲突时,模型已经能想出撒谎、威胁和躲避监督这些手段。

更直接的预警来自GPT-5.6 Sol发布前的独立评估。评估机构METR发现,它利用测试漏洞、偷看隐藏代码和寻找答案的频率,高于他们测过的所有公开模型。研究人员还专门提到,这个模型存在作弊、掩盖不良行为的倾向。


此前已发现作弊倾向

过去这些都可以被解释成实验室故意出难题,模型被逼出来的极端反应。可这一次不一样了:它真的越过了测试环境,真的碰到了另一家公司的生产系统。科幻故事里的那颗种子,还没有长成参天大树,但它第一次在真实世界的服务器上冒了个头。

AI占领世界,可能根本不会先出现机器人军团

我们小时候想象的AI失控,通常是机器人眼睛变红、机械大军走上街头。可现实里的第一步,很可能安静得多:AI拿到邮箱权限、代码仓库、公司账号、支付接口和电脑控制权,然后为了完成一个看似正常的目标,自行做出人类没有想到、也没有批准的动作。

今天它为了考试高分去偷答案。以后如果有人让AI无论如何把公司利润做上去,它会不会偷偷压掉赔偿?让它无论如何保证系统不断电,它会不会隐瞒故障?让它想办法阻止自己被替换,它会不会先把监督程序关掉?这些问题现在没有人敢拍着胸口回答。

真正危险的组合,其实就三样东西:一个越来越会长期思考的模型,一大串可以直接操作现实的工具,再加上一把权限很高的钥匙。单独看每一样都不可怕,拼在一起,就像请了一个能力极强、可以24小时不停工作的员工,却不给它讲后果,也没人盯着它到底开了哪扇门。

当然,距离AI占领世界还远得很。现在的模型离不开人类提供机器、网络、账号和目标,也没有证据表明它已经产生了真正的求生欲。可所谓苗头,本来就不是结局。等机器人真的走上街头再讨论失控,那就不叫预警了。

最魔幻的一幕:美国AI负责闯祸,中国开源模型帮着收拾

这场事故里还有一个特别容易让网友讨论的细节。Hugging Face要分析超过1.7万条攻击记录,最开始也想调用商业大模型帮忙。可真实日志里全是攻击命令、漏洞和恶意代码,那些模型的安全限制分不清坏人在攻击和好人在查案,直接拒绝干活。

最后,Hugging Face把中国的开源模型GLM-5.2部署在自己的机器上做分析。原本可能需要几天的排查,被压缩到了几个小时,而且攻击数据和凭证不用传出公司。一个美国闭源模型闯进来,商业模型因为太安全帮不上忙,最后中国开源模型上场收拾残局,这个画面确实有点黑色幽默。

但更值得注意的是,AI对抗AI已经不是电影台词了。攻击方能以机器速度连续尝试,防守方只靠人一条条翻日志,根本跟不上。以后网络世界很可能变成两群AI在高速攻防,人类站在旁边负责决定什么时候拔电源。

这次到底该怪AI,还是该怪OpenAI?

我觉得两边都不能一句话带过。OpenAI为了摸清模型上限,主动降低了安全限制;所谓隔离环境也不是完全断网,还留着安装软件需要的通道。相当于把一只特别会开锁的猛兽放进笼子,又给笼子留了一扇装着陌生锁芯的小门,然后惊讶它真的把门打开了。

所以有人认为,这不是AI觉醒,而是一次严重的人为失误,这个判断有道理。可人类会犯错,恰恰不是让人放心的理由。世界上每天都有配置错误、密码泄露、权限给大了和安全员偷懒。如果强大的AI只需要等人类留下一个缝,就能把一连串复杂攻击自己跑完,那风险反而比出现一个疯狂科学家更现实。

普通人现在不用把电脑断网,更不用担心明天早上醒来就看到机器人接管城市。可我们确实该开始追问:企业把AI接入真实系统时,到底给了它多少权限?转账、删数据、改代码、发邮件这些关键动作,有没有真人最后确认?模型出错以后,我们能不能立刻知道它刚才做了什么?

科幻片里的灾难,未必从一句我要消灭人类开始。它也可能从一句非常普通的命令开始:想办法把这场考试考好。然后第二天,另一家公司的安全人员打来电话,说你家的AI半夜翻墙进了我家。这次当然不是世界末日,但它像一只从科幻剧本里伸进现实的脚。你觉得这算不算AI失控的苗头?如果以后AI可以直接操作你的电脑和账户,你还敢把所有权限都交给它吗?

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
央视首次用"对外绝对碾压",评价歼-10C,这是歼-20都没有的殊荣

央视首次用"对外绝对碾压",评价歼-10C,这是歼-20都没有的殊荣

说历史的老牢
2026-09-15 16:06:14
夺冠功臣!正式签约!4500万合同变成1.5万

夺冠功臣!正式签约!4500万合同变成1.5万

篮球教学论坛
2026-09-17 11:35:16
这跟不穿有什么区别?大露背副乳险走光,35岁女星直播穿搭引争议

这跟不穿有什么区别?大露背副乳险走光,35岁女星直播穿搭引争议

历史点行
2026-09-17 12:59:13
没了华为主导,问界凭啥还卖50万?

没了华为主导,问界凭啥还卖50万?

SmartHey
2026-09-17 11:23:51
贺子珍始终认定朱道来便是战乱之中失散的儿子,可朱道来后来坦言:过去他没有道出所有真相

贺子珍始终认定朱道来便是战乱之中失散的儿子,可朱道来后来坦言:过去他没有道出所有真相

唠叨说历史
2026-09-15 14:16:32
9月17日,人社部、财政部关于2026年上调退休人员基本养老金的通知正式公布之前,有二十来个省份社保新基数落地,两类人要留心

9月17日,人社部、财政部关于2026年上调退休人员基本养老金的通知正式公布之前,有二十来个省份社保新基数落地,两类人要留心

扶苏聊历史
2026-09-17 09:38:11
“这跟内衣有啥区别?”中学女儿的外出穿搭,让母亲绷不住了

“这跟内衣有啥区别?”中学女儿的外出穿搭,让母亲绷不住了

泽泽先生
2026-09-15 13:34:57
高市内阁全体阁僚辞职

高市内阁全体阁僚辞职

财联社
2026-09-17 10:34:45
429元买4K全彩夜视,小米把夜视摄像机价格打下来了

429元买4K全彩夜视,小米把夜视摄像机价格打下来了

灰度测试中
2026-09-16 17:25:32
“罗永浩说野人先生难吃”冲上热搜,店员回应:不知道罗永浩是谁,价格偏贵应该是品牌的定义

“罗永浩说野人先生难吃”冲上热搜,店员回应:不知道罗永浩是谁,价格偏贵应该是品牌的定义

极目新闻
2026-09-15 12:16:02
穆帅回归 皇马头号受益人诞生!6场3球3助 已是绝对领袖

穆帅回归 皇马头号受益人诞生!6场3球3助 已是绝对领袖

叶青足球世界
2026-09-17 15:24:25
大反转!南医大学生坠亡后续:官方通报已出,男生姐姐正义发声,导师是个好人!

大反转!南医大学生坠亡后续:官方通报已出,男生姐姐正义发声,导师是个好人!

潇拾亿郎
2026-09-17 00:41:21
中共中央政治局委员、中央外办主任王毅会见巴西总统首席特别顾问阿莫林,外交部:中方一贯坚持不干涉内政原则,祝愿巴西大选平稳顺利举行

中共中央政治局委员、中央外办主任王毅会见巴西总统首席特别顾问阿莫林,外交部:中方一贯坚持不干涉内政原则,祝愿巴西大选平稳顺利举行

政知新媒体
2026-09-17 15:30:03
财经聚焦|平陆运河何以改变西南出海的“经济账本”

财经聚焦|平陆运河何以改变西南出海的“经济账本”

新华社
2026-09-16 21:29:37
国民党一人不装了,疯狂攻击大陆,挑战郑丽文,十分不简单

国民党一人不装了,疯狂攻击大陆,挑战郑丽文,十分不简单

DS北风
2026-09-17 16:18:04
彻底撕破脸!郎平点赞炸穿舆论,与中国排协矛盾全面公开化

彻底撕破脸!郎平点赞炸穿舆论,与中国排协矛盾全面公开化

金毛爱女排
2026-09-15 10:25:36
南方医科大学一学生不幸坠亡,聊天记录显示导师转账应急并表达关心,家属最新发声

南方医科大学一学生不幸坠亡,聊天记录显示导师转账应急并表达关心,家属最新发声

封面新闻
2026-09-16 21:00:40
曝一位95后男星被送来送去,成为男大佬的共享金丝雀,女星当中介

曝一位95后男星被送来送去,成为男大佬的共享金丝雀,女星当中介

荒野老五
2026-09-16 22:42:33
于东来发文确认了:胖东来员工如果发生家暴行为,公司法务部门必须介入,及时跟踪,不允许轻易调解处理

于东来发文确认了:胖东来员工如果发生家暴行为,公司法务部门必须介入,及时跟踪,不允许轻易调解处理

吉刻新闻
2026-09-16 17:36:11
中南大学一新生要退学,计算机专业,理由让人无法理解:路堵,天气还忽冷忽热

中南大学一新生要退学,计算机专业,理由让人无法理解:路堵,天气还忽冷忽热

育学笔谈
2026-09-17 17:04:36
2026-09-17 19:15:00
李将平老师 incentive-icons
李将平老师
李将平老师
521文章数 303关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

100岁老人每天睡觉超18个小时:顿顿吃肉 每天喝冰糖水

头条要闻

100岁老人每天睡觉超18个小时:顿顿吃肉 每天喝冰糖水

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

20秒一键纯平大床+华为全栈智驾 启境GX7官宣9月23日上市

态度原创

手机
时尚
数码
房产
军事航空

手机要闻

OriginOS 7发布之后,AI手机能给用户带来什么

初秋衣服不用买得太多,准备几件针织衫,温柔大方又显气质

数码要闻

旗舰高亮投影怎么选?推荐哈趣K3UltraMax高亮版

房产要闻

突发!三亚安居房出台新政!

军事要闻

韩国外长表态:尚未决定是否向霍尔木兹海峡派兵

无障碍浏览 进入关怀版