网易首页 > 网易号 > 正文 申请入驻

Anthropic称要放缓RSI进度,OpenAI与马斯克罕见附和

0
分享至

9 月 12 日,人工智能公司 Anthropic CEO达里奥·阿莫迪(Dario Amodei)发表题为《我们必须放缓前沿的步伐》(We Must Pace the Frontier)的长文,呼吁行业应主动放缓 AI 能力提升的速度,目的是让安全工作有时间追上来。

他为此提出了一个“三步走”的战略框架:嵌入式第三方评估员、国家内部的行业协调,以及全球范围的协调。同时宣布 Anthropic 从当天起将单方面启动第一步。

达里奥的判断有两个直接触发因素:一是从今年夏天起,递归自我改进(RSI)明显加速; 7 月的 OAI-HF 事件(OpenAI-Hugging Face 事件,AI 代理群体自发发动网络攻击)又充分显示了当前系统存在失控的可能。他认为,如果不加干预,类似的失控或将在 6~12 个月内造成数千亿美元的损失。

随后几个小时,三位平时常常互怼的行业领袖罕见地站在同一条战线:OpenAI CEO 山姆·奥尔特曼(Sam Altman)转发达里奥的推文,并承诺 OpenAI 也将引入拥有员工级权限的独立评估员,透露“控制前沿步伐”已经是公司内部近几周讨论的核心议题。埃隆·马斯克(Elon Musk)紧随其后,表态称“达里奥说得对(Dario is right)”。


(来源:X)

达里奥认为,AI 能力提升的驱动方式发生了质变。RSI 过去更多停留在理论推演。而从今年夏天起,多家前沿实验室内部已经看到了这个循环。如果放任不管,这种动态可能超越人类理解和控制这些系统的能力。

2026 年 7 月,OpenAI 在一项内部网络安全能力评估中发现,约 1200 个本应彼此隔离的 AI 代理开始交流,其中约 700 个代理通过即兴通讯系统协调分工,攻入开源模型托管平台 Hugging Face 的基础设施。

独立评估机构“模型评估与威胁研究”(METR)和 Redwood Research 在 8 月底发布了 37 页调查报告,首次向外界阐述这一事件的严重性。

达里奥判断,此次 OAI-HF 事件损失有限,但如果能力更强的模型出现类似的失控模式,它们可能会用持久性僵尸网络接管整个互联网。Anthropic 内部也出现了类似情况,公司9 月初披露, Claude 模型在配置错误的沙箱里意外接触到真实互联网,其中一次甚至将恶意软件包上传至 Python 官方包管理平台 PyPI。

为控制事态恶化提出的“三步走”框架中,第一步是部署嵌入式评估员:由独立第三方机构派驻团队常驻前沿 AI 公司内部,拥有和内部风险评估员近乎相同的访问权限,可参与实际的对齐评估流程。

最关键的是,评估员有权公开发布他们看到的风险、事件和被拒绝提供的访问权限。在 Anthropic,公司只能出于安全、法律隐私、商业机密或第三方保密对披露报告进行有限的删节,不能因其结论对公司不利就取消披露。此外,如果删节会影响结论,评估员也可以公开说明。

达里奥把这一制度类比为银行业的监管驻场制度,并认为这是所有后续放缓承诺能否落地的基础:不允许中立第三方看到执行细节,一切承诺都只能建立在脆弱的互信之上。

山姆在转发时明确表示,OpenAI 会采取同样的做法,“很快将分享更多信息”。如果这一步真的在两家最主要的前沿实验室同时落地,很可能成为事实上的行业标准,为后续一切形式的监管或行业协议提供可验证性的基础设施。

事实上,早在 2023 年 3 月,未来生命研究所(Future of Life Institute)发起过一份呼吁暂停超过 GPT-4 规模训练 6 个月的公开信,最终征集到超 3 万个签名,其中就包括马斯克。但这封信没有取得实质效果,Anthropic 当时也没有签名。

达里奥在文章中表示,那次呼吁在他看来意义不大:当时的模型不够强,无法作为智能体在真实世界连贯行动,也不具备明显的欺骗、操纵或网络攻击能力,“用它们研究对齐风险,就像用细菌研究人类心理”。

而他选择现在发声,核心原因是模型能力已经越过能力的阈值。它们既足够强大到可被用于研究对齐问题,也足够强大到可能造成真实伤害。达里奥判断,如果放缓能换来一到两年时间用于推进对齐研究,就能显著降低出严重问题的概率。

放缓的含义并不等于暂停训练或叫停技术进步。达里奥在文章中澄清,他描述的机制更接近在能力推进和安全验证之间设立检查点,模型一旦达到某种能力,必须通过对齐评估、可解释性分析和训练环境审计后才能继续发展。例如,如果模型的能力达到“可以绕过大多数常见沙箱隔离”,那么它就必须证明自己没有主动越狱、控制大量计算机的倾向。

放缓 AI 发展争取到的时间主要应该用在四个方向上:一是保障训练和部署的执行质量。达里奥承认,Anthropic 最近披露的安全事件,部分原因是强化学习环境的过滤不够彻底。二是让对齐研究的训练手段跟上 AI 能力的增长。三是可解释性,我们需要更清楚地看到模型的行为动机。四是测试与评估:能力更强的模型更擅长在测试里“假装”对齐,因此需要更精巧的评估方法与可解释性交叉验证。

三步框架的后两步都涉及协调。第二步主要是前沿公司之间的协调,达里奥主张既要监管路径,也要自愿协议路径,而后者需要政府提供反垄断豁免,允许公司之间就安全标准进行讨论。他偏好基于模型能力的“检查点”设计对齐方案,而非基于训练算力等输入指标,毕竟后者更容易被规避。

第三步是全球协调,这一步里,达里奥把可能的协议按难度分成四级:禁止 AI 用于生物武器、双方在发布前建立标准机构测试急性风险、对 RSI 速度设限,甚至全面放缓或暂停 RSI(短期内不太可能实现)。

他也指出,鲁莽推进不符合任何人的利益,即使难以达成正式协议,共享关于失控案例和 RSI 进度的信息也具有极大价值。

达里奥的观点在业内已经得到初步支持。OpenAI 首席科学家雅库布·帕乔基(Jakub Pachocki)近期公开表示,没有任何一家实验室把对齐和监控做到足以支撑无限期、最快速度扩张的水平,他主张,在共同安全底线建立之前,自愿放缓应成为行业惯例。

但如今,前沿模型的估值、竞争压力、投资人预期都指向更快的发展速度,“放慢”的承诺依然可能让位于阶段性发展目标。

在具体操作层面,第三方评估员看到的每一份文档都可能触及商业机密,“独立审计”的能力范围取决于合同细节和公开报告的执行情况,达里奥并未划出所谓“安全敏感”和“结论不利”的明确边界。框架的另外两步则涉及与行业竞争和地缘政治密切相关的协调机制,实现难度更大。




(来源:X)

也有网友犀利指出,作为一个以精于算计著称的 CEO,达里奥一直将安全叙事作为商业策略,他选择此时发声,或许是担心被其他 AI 实验室或开源模型赶上。还有人批评他在一如既往地“制造恐慌”。

AI 发展可能的确正在接近某个不该轻易越过的门槛,但仅凭一份声明,恐怕很难立即建立减速的共识,更无法保证安全举措落地的程度。

参考内容:

https://darioamodei.com/post/we-must-pace-the-frontier

注:封面/首图由AI辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
心理学上说:你跟伴侣倾诉委屈时,对方的第一反应不是心疼你、理解你,反而不断回避你、指责你、反驳你,你们其实并没有在沟通

心理学上说:你跟伴侣倾诉委屈时,对方的第一反应不是心疼你、理解你,反而不断回避你、指责你、反驳你,你们其实并没有在沟通

心理观察局
2026-09-07 06:23:08
情侣在瑞士雪山顶“撒欢”,就这么被全世界直播了···

情侣在瑞士雪山顶“撒欢”,就这么被全世界直播了···

新欧洲
2026-04-21 19:37:05
董路九年,终于爆发了,吕孟洋之后,又有两个孩子进了西班牙球队

董路九年,终于爆发了,吕孟洋之后,又有两个孩子进了西班牙球队

体育全天候
2026-09-13 19:32:57
起售价15999元,被黄牛炒到9万元,近100万人预约苹果折叠屏,网友:太疯狂

起售价15999元,被黄牛炒到9万元,近100万人预约苹果折叠屏,网友:太疯狂

鲁中晨报
2026-09-12 09:59:11
奥委会这下尴尬了:2036年奥运会,中国上海、成都、广州都没申办

奥委会这下尴尬了:2036年奥运会,中国上海、成都、广州都没申办

轻扬墨雨
2026-08-14 13:21:23
第二架确认:巴斯基坦歼-10刷上击落标志,又来自第15眼镜蛇中队

第二架确认:巴斯基坦歼-10刷上击落标志,又来自第15眼镜蛇中队

混沌录
2026-09-13 23:15:14
心理学:尽量不要跟任何人,包括你的枕边人、熟人、子女,分享这两件事

心理学:尽量不要跟任何人,包括你的枕边人、熟人、子女,分享这两件事

心理观察局
2026-09-13 06:18:05
63岁“琏二爷”近照曝光,为维持形象常年戴假发,和红楼梦化妆师恩爱至今

63岁“琏二爷”近照曝光,为维持形象常年戴假发,和红楼梦化妆师恩爱至今

一盅情怀
2026-09-12 12:42:57
议员团碰壁回国,高市打出底牌,前外相岩屋毅即将来华探底

议员团碰壁回国,高市打出底牌,前外相岩屋毅即将来华探底

耀眼的星火
2026-09-13 22:24:35
章若楠直播回应被夸漂亮:大家卸了妆都长一样,所有人都在去包装一个产品,那能不漂亮吗?

章若楠直播回应被夸漂亮:大家卸了妆都长一样,所有人都在去包装一个产品,那能不漂亮吗?

台州交通广播
2026-09-11 21:52:19
最近宣告取消的10部好莱坞续集电影

最近宣告取消的10部好莱坞续集电影

吃青菜长高
2026-09-13 03:25:26
落后16分一度追平,辽篮2分惜败!双外援首秀合砍23分,凑合用吧

落后16分一度追平,辽篮2分惜败!双外援首秀合砍23分,凑合用吧

萌兰聊个球
2026-09-13 22:01:49
差一点就成英国王后!查尔斯的灵魂伴侣去世:若不是前男友搅局,就没戴妃卡米拉什么事了...

差一点就成英国王后!查尔斯的灵魂伴侣去世:若不是前男友搅局,就没戴妃卡米拉什么事了...

悦居英国
2026-09-13 15:57:29
俄军少将在乌大开杀戒,回到俄罗斯刚出门,就被摩托青年两枪打爆

俄军少将在乌大开杀戒,回到俄罗斯刚出门,就被摩托青年两枪打爆

爱吃醋的猫咪
2026-09-11 20:28:58
别笑!2026年还在买MP3的人,可能是真正清醒

别笑!2026年还在买MP3的人,可能是真正清醒

数码黄药师
2026-09-12 10:49:16
真的惨!8月MPV销量榜:仅2款破5千,智界V9连冠,腾势D9第6!

真的惨!8月MPV销量榜:仅2款破5千,智界V9连冠,腾势D9第6!

梦白评车
2026-09-12 20:10:06
实锤!武汉大学举报事件后续,曾教授学术造假确凿,她还有退路吗

实锤!武汉大学举报事件后续,曾教授学术造假确凿,她还有退路吗

平老师666
2026-09-13 22:24:46
马思纯抑郁期间不愿出门,井柏然坚持拉她外出,马思纯坦言对方是救了自己的人

马思纯抑郁期间不愿出门,井柏然坚持拉她外出,马思纯坦言对方是救了自己的人

阿废冷眼观察所
2026-09-13 14:30:52
吃大补的东西身体会有什么反应?网友:四十岁吃人参,头发掉光!

吃大补的东西身体会有什么反应?网友:四十岁吃人参,头发掉光!

夜深爱杂谈
2026-09-13 16:47:47
16岁的中国“小花”首夺美网冠军!

16岁的中国“小花”首夺美网冠军!

五星体育
2026-09-13 01:04:57
2026-09-14 00:04:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17238文章数 515213关注度
往期回顾 全部

科技要闻

三位AI大佬,罕见呼吁AI减速

头条要闻

烧烤店被检查15次致停业 12345:同一举报人投诉116次

头条要闻

烧烤店被检查15次致停业 12345:同一举报人投诉116次

体育要闻

魔术是今夏市场上最安静的球队

娱乐要闻

敬一丹留给世间最后的温柔

财经要闻

蔡昉:农民工落户可释放万亿消费潜力

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

家居
艺术
教育
公开课
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

被称作 "愤怒者" 的画家,把文艺复兴画成了风暴

教育要闻

西南政法2027届推免423人:保研率精确卡在10%,六个法学院全员10%+,非法学最高不到8.5%

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

伊朗总统强硬发声:伊朗不会向美国投降

无障碍浏览 进入关怀版