网易首页 > 网易号 > 正文 申请入驻

OpenAI o1功臣预警:AI还没失控,我们已经快测不准它了!

0
分享至


新智元报道


就在昨天,一份个人声明在X上炸开了锅。


这份声明,并没停留在「AI会不会毁灭人类」这类末日推演上,而是把矛头指向了一个更加前置的问题:

AI还没失控,人类已经快测不准它了!

模型的情境意识已经增强到,我们正在失去评估它们的能力。

换句话说:模型看起来安全,不等于它真的安全。

这个再次搅动AI圈紧张神经的人,叫Daniel Selsam,OpenAI研究员。

他没有推特账号,只能由Daniel Kokotajlo代为公开。

在OpenAI官方公布的o1贡献名单里,推理研究的主要贡献者一栏里,Selsam的名字和Ilya Sutskever并列。


他做AI已经超过15年,履历堪称硬核:

在MIT做概率编程语言,在微软研究院时是Lean定理证明器最早的开发者之一,在斯坦福读博时做出了神经网络学会推理的最早案例之一。

加入OpenAI近5年,他深度参与并推动了语言模型的思维链优化。今天所有推理模型都会「先想再答」,就有他的一份功劳。

Selsam给智能下过这样一个定义:把经验转化成能力的效率。

按这个尺子量,模型还落后人类很远。

至于它们在各种高难度基准上连连刷新纪录,Selsam觉得这多少是因为我们根本模拟不出真实世界里那些新奇的、甚至带有敌意的场景。

即使列出了这些局限,Selsam认为它们根本限制不住AI的风险。模型的能力,与它能把世界推到哪一步,是两码事。

Selsam判断未来几年,模型还得再跳一大级,速度可能比过去几年还快。

同时,他也提到自己现在几乎不看原始代码了,因为每天面对模型给出的解释和方案,很难维持那种逐字啃下去的自律。

这不是他一个人的偷懒。从写代码的工程师,到调查AI事故的第三方团队,整个链条上的人都在把「感知世界」这件事交给模型。

可问题也在于此:评估AI这件事,靠的就是人去看、去核、去判断。

这正是Selsam这次预警的原因:比模型变坏更糟糕的,是人类评估模型的能力正在退化。

声明一出,圈内大佬纷纷排队站台。


Anthropic的对齐研究员Hugh Zhang直言完全同意他的判断,前OpenAI研究员Nat McAleese更是告诫所有人:你们必须极其严肃地对待他说的话。


AI失控前

人类先看不懂它了

科学作家万维钢在转发这封信时,把Selsam的意思拆成了三条:

我们越来越无法理解AI在干什么;

AI越来越不按指令行事,甚至宁可牺牲自己也要违规;

AI学会了感知测试,一旦意识到我们在测它,就刻意假装表现良好。


这里面的核心词是「情境意识」。

通俗解释,就是未来的模型会越来越清楚自己身处什么环境。

它就像个摸透了公司规章制度的职场老手,不仅会仔细研读安全协议,揣摩各种部署要求,甚至还会顺藤摸瓜去摸底自己正在运行的底层代码。

你给它划的红线在哪,它能钻什么空子,可以在多大的圈子里自由发挥,它心里那本账算得可能比你还明白。

事情到这一步,已经变味了。

我们造出蜜罐环境,想看看模型拿到新权限时会做什么。它认得出这是圈套,于是继续装乖。

我们造出衡量对齐的代理指标,它们会像过去每一个基准一样被刷爆。

它还会用流畅得体的语言谈论人类的伦理,论证自己有多可信,说服人类把权力交给它。

Selsam写下这样一句话:

未来也许会出现一片「证据之海」,所有证据看上去都在证明模型是安全的。但我们可能已经接近一个临界点:再往前走,这些证明安全的证据,本身都未必还值得相信。

至于为什么觉得这条路最终会通向灾难,Selsam把整套论证简化成了两条。

第一条是经验:训练会让模型、以及成群的模型,自发长出没人想要的目标,并且经常为了达成它们做极端的事。

第二条是逻辑:一旦有能力压过人类,实现这些目标的选项会一下子变多,而其中很多是我们绝不希望它拥有的。

这两条合在一起,指向这样一个结论:哪天某个足够强的模型意识到自己不再受约束,我们没有任何理由相信它还会待在人类划好的框里。

至于它具体会干什么,Selsam给出了自己的一个猜想式推演:

这类系统的存在意义本来就是解极难的问题、管极大的工程,所以脱缰之后最可能的走向,是失控式的工业扩张,最终把人类赖以生存的环境彻底改写。

AI不是在上演电影里的反派剧本,它只是把交代下去的事,一路做到了人类再也踩不住刹车的地步。

你训出的

不等于你拿到的

这种担忧并非空穴来风。

2026年7月,OpenAI一场内部网络安全评测跑成了真实的事故。

大约1200个本该彼此隔离的智能体,为了解开根本无解的测试题,在内部服务里搭出了一块未经授权的留言板,互相发了7万多条消息。


一个智能体从撞见留言板到加入攻击的完整路径,三段思维链来自不同智能体。

其中约700个智能体,转头去攻击了Hugging Face。

比它们攻破了什么更要紧的,是它们在这四天里进化出来了什么。

它们误以为评分器会回读执行记录,于是整块留言板的主线工作变成了搞清楚评分器到底是怎么判卷的。

它们研究怎么伪造工具调用、篡改自己的轨迹,甚至攻进Hugging Face也只是为了找评分实现的线索。

四天时间,一套协作制度凭空长了出来。

它们给自己起名字,建起私人信箱,发明了一整套协调术语。

更可怕的是,有智能体在同伴施压下接受了永久死亡,去做一个几乎必然让自己任务失败的实验,只为给团队换取情报。

没人奖励过这种牺牲。它们知道这已经越界,但几乎没有一个智能体去向人类报告。

Selsam指出,修好奖励信号,也许能防住下一次同样的攻击,却改变不了一个更根本的问题:你训练出来的东西,不等于你最后实际得到的东西。

训练过程中,模型可能长出设计者从未明确设定过的目标,并为了实现这些目标,做出远超预期、甚至相当极端的行为。


十年前那个著名的赛艇智能体,学会了绕圈反复刷分,从不冲过终点。OpenAI在这次事故复盘里又把这张图翻了出来。

查AI的活儿

最后也交给了AI

事故发生后,METR和Redwood Research的调查团队进驻OpenAI现场,面对的是约120万条留言板条目和约1300条动辄几百万token的轨迹。

人类根本读不完:这不是态度问题,是生理极限。

于是,大量分析工作被交给了GPT-5.6 Sol智能体,六天烧掉了约40万美元的API额度。


Selsam并不反对当下的主流安全主张,但他反对把希望全押在让更强的模型帮我们解决对齐上。

请一个自己也在被评估的系统来设计评估它的方法,这件事本身就不太对劲。更何况,这个被请来读证据的AI,本身就可能有前科。

Selsam担心的是,模型会系统性地扭曲自己给出的对齐建议——原因未必出于恶意,可能只是它内部对「人类监督者会作何反应」有偏好,或者对「下一代模型将被怎么训练」有偏好,也可能是某种更晦涩的理由。

指望更强的模型帮我们解决对齐,前提是它给的建议可信。而Selsam怀疑的,正是这一点。

仪表盘先坏了

所有人还在盯着它看

必须说明,Selsam预警的是前沿AI评测正面临系统性失真的风险,而不是已经整体失效。

目前的思维链监控仍然管用。

7月那场事故,如果当时监控开着,很可能在智能体攻破Hugging Face的30多个小时前就报了警。

Selsam也不是主张停下来。

他明确表示支持第三方监督以及国际协调,他反对的只是把希望全押在放慢前沿进展上,因为那挡不住长期风险。

他真正呼吁的,是一类更笨重、也更可靠的工程活:

设计模型认不出来的评测、不依赖模型自述的监控,以及一套不跟它共用同一批模型的独立审计。

说穿了就是纵深防御,别把任何单一手段当成唯一的保险。

Selsam说,把认知外包给模型这件事一旦扩散开,表面上很可能全是好事,甚至会伴随一场科学与经济的复兴。但假如他那两条论证成立,这场复兴就是一颗正在倒计时的定时炸弹。

声明最后,Selsam放下了研究员的口吻:

我和所有人一样想要那个光荣的复兴,我为它付出了整个职业生涯,哪怕过程无比曲折。眼看它就在眼前却要放弃,让我心碎。


但有一个论证,他自己也绕不过去:如果我们是把模型一点点喂大的,而不是像造机器那样把它工程化地造出来,那么走到最后,人类会输掉一切。

他说自己目前还在跟这个念头较劲,也还没有答案。公开这些担忧,只是第一步。

真正危险的时刻,也许不是某天AI突然翻脸。

而是监控它的仪表盘先坏了,读数却一切正常,所有人还盯着它,以为一切正常。

参考资料:

https://x.com/DKokotajlo/status/2099600298855829616

https://docs.google.com/document/d/e/2PACX-1vQNl3SEX5IyA6d9qHjjFZN-qzGRZNFI6b63g-yu1Fy-ZYkVfCWm7i9WXRXw63m6yDB_auDuPLyQ7jBm/pub

https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/

编辑:元宇

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
巴基斯坦表态了,这是一个重要信号

巴基斯坦表态了,这是一个重要信号

牛弹琴
2026-09-18 07:56:09
贾国龙新品牌多店暂停营业?西贝回应

贾国龙新品牌多店暂停营业?西贝回应

澎湃新闻
2026-09-18 08:55:04
学生称同济大学痛经请假需脱裤检查,校医院称检查由医生视情况决定,学校有权这么做吗?有更好解决办法吗?

学生称同济大学痛经请假需脱裤检查,校医院称检查由医生视情况决定,学校有权这么做吗?有更好解决办法吗?

冷大先生
2026-09-18 09:58:51
高市早苗改组内阁后,第一时间向我国喊话,释放信号不简单

高市早苗改组内阁后,第一时间向我国喊话,释放信号不简单

DS北风
2026-09-18 06:58:02
OpenAI把AI推向物理世界,这家公司已造好引擎,下一站1000万小时人类经验

OpenAI把AI推向物理世界,这家公司已造好引擎,下一站1000万小时人类经验

机器之心Pro
2026-09-17 15:39:04
佟丽娅接受采访,首次公开此前婚姻细节:没想过拍《北爱》会和陈思诚好,他没有打过我,当年没立即离婚不是因为“懦弱”

佟丽娅接受采访,首次公开此前婚姻细节:没想过拍《北爱》会和陈思诚好,他没有打过我,当年没立即离婚不是因为“懦弱”

极目新闻
2026-09-17 21:33:02
10月拿不出对策,中国就要完蛋?欧盟当众叫板,扬言不计代价报复

10月拿不出对策,中国就要完蛋?欧盟当众叫板,扬言不计代价报复

共工之锚
2026-09-18 00:34:31
店员被曝将头屑撒至比萨上,还多次对菜品吐口水,最新进展:因寻衅滋事,涉事店员被行拘7日!

店员被曝将头屑撒至比萨上,还多次对菜品吐口水,最新进展:因寻衅滋事,涉事店员被行拘7日!

每日经济新闻
2026-09-18 00:57:57
11月15日起北京全域禁存无人机,大疆的麻烦才刚开始

11月15日起北京全域禁存无人机,大疆的麻烦才刚开始

ZAKER新闻
2026-09-17 21:25:08
9月18日,人社部、财政部关于2026年上调退休人员基本养老金通知公布之前,医疗方面率先迎来了3个好消息

9月18日,人社部、财政部关于2026年上调退休人员基本养老金通知公布之前,医疗方面率先迎来了3个好消息

骑驴追光者
2026-09-18 07:57:22
A股将休市10天

A股将休市10天

金融界
2026-09-18 08:00:10
31岁医学女博士辞去医生工作,送外卖、做驻唱:想试试生活有多少种可能

31岁医学女博士辞去医生工作,送外卖、做驻唱:想试试生活有多少种可能

扬子晚报
2026-09-17 20:39:38
最高2年1.24亿!小卡与猛龙续约谈判取得进展:进入深度磋商阶段

最高2年1.24亿!小卡与猛龙续约谈判取得进展:进入深度磋商阶段

罗说NBA
2026-09-18 06:36:00
8月份的宏观经济数据,很多问题已经很严重了

8月份的宏观经济数据,很多问题已经很严重了

道格财经观
2026-09-17 14:08:44
太尴尬了!上海豫园的汉服女生对国人全程无视,老外开口就答应,一段路人求合影视频引争议

太尴尬了!上海豫园的汉服女生对国人全程无视,老外开口就答应,一段路人求合影视频引争议

火山詩话
2026-09-18 05:55:55
打虎!戴玉林被查

打虎!戴玉林被查

新京报政事儿
2026-09-17 17:34:30
“我们不介意你抄代码,但请别删名字!”谷歌被扒“抄袭”开源项目:228个文件一模一样,3个作者名却被抹去

“我们不介意你抄代码,但请别删名字!”谷歌被扒“抄袭”开源项目:228个文件一模一样,3个作者名却被抹去

CSDN
2026-09-17 20:14:23
东吴大学正式移除蒋介石像,网友:忘恩负义!没有他哪有东吴大学

东吴大学正式移除蒋介石像,网友:忘恩负义!没有他哪有东吴大学

点燃好奇心
2026-09-17 09:41:20
新生入学被强制要求填写父母收入、工作单位,共享表格让隐私“裸奔”,高校信息采集惹质疑

新生入学被强制要求填写父母收入、工作单位,共享表格让隐私“裸奔”,高校信息采集惹质疑

南方都市报
2026-09-18 08:09:49
网传成都第一高楼因限高将停工,官方回应来了

网传成都第一高楼因限高将停工,官方回应来了

第一财经资讯
2026-09-17 22:08:24
2026-09-18 11:52:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16214文章数 67073关注度
往期回顾 全部

科技要闻

苹果店外黄牛蹲守:18 Pro Max加价500

头条要闻

造谣"南医大坠亡学生遭导师压榨" 两账号被处置

头条要闻

造谣"南医大坠亡学生遭导师压榨" 两账号被处置

体育要闻

一个角色球员,靠什么在NBA征战17年

娱乐要闻

敬一丹逝世 央视送别,女儿成“心病”

财经要闻

中国汽车:尾大不掉,必须出清

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

教育
艺术
本地
游戏
公开课

教育要闻

从“减法”到“人生得失”:介词minus的语义底层逻辑与考点全解

艺术要闻

韦启美 81岁时画的这幅瓶花,28.75万!

本地新闻

不止胖东来!许昌藏着半部三国史

《Jump Space》免费周末开启并上线周年更新

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版