3步方案没有限速值,第1步已有人承诺。
2026 年 9 月 12 日,Anthropic 首席执行官达里奥·阿莫代伊发了一篇长文。
标题是《We Must Pace the Frontier》,直译是为前沿设定节奏。
主张一句话:放慢提升模型能力的速度,给安全评估和防护措施留出时间。
接下来几天,OpenAI、xAI、Google DeepMind 的三位负责人先后公开表态支持。
三家平时在同一个赛道上抢位置,同一周说同一句话。
但真正值得看的不是共识本身。
是这份方案自己的排序,和它留白的部分。
本文事实来自:新浪财经 2026 年 9 月 14 日的转述、Unite.AI 与 RuntimeWire 对原文的逐段引述,以及 OpenAI 2026 年 8 月 26 日的技术报告和 METR 同日发布的独立调查报告。
没有采访,没有实测,全部是公开材料。
共识落在第一步,因为只有它不用别人同意
方案分三步,难度一层比一层高。
第一步,常驻独立评估人员。前沿企业向第三方评估团队提供持续、接近员工级别的访问权限。
第二步,主要实验室之间的安全标准协调。就风险测试、安全门槛和模型发布条件形成共同标准。
第三步,政府间协调,做跨国风险管控。
![]()
图 1 三步方案与各自的推进条件
三步的推进条件完全不同。
第一步只需要一家公司自己决定。Anthropic 已公开承诺单方面率先实施。
第二步需要同行和监管机构同时点头。原文提到,竞争者之间某些形式的协调本来会面临法律障碍。
第三步需要政府之间谈。
来源:新浪财经 2026-09-14;Unite.AI 2026-09 对原文的引述。
![]()
图 2 公司自己能决定的部分与需要第三方同意的部分
补一句原文的表述:三步不必严格按顺序执行。
第一步给的是权限,配套的一栏是空的
第一步的执行主体是 Anthropic 自己,所以细节披露得最具体。
办公场所设独立评估团队工位,配工牌和公司电脑。
工作区、工具和权限,与公司内部风险评估团队大致相当。
例外有两类:法律或合同要求的,以及涉及客户和合作伙伴私人信息的。
最关键的一条是发布权:评估团队可就风险水平、事故、实践以及自己拿到的访问权限公开发表关键发现。
前提是不受 Anthropic 编辑控制。
原文给的参照物是银行业,监管人员常驻在银行内部办公,而不是只做外部审计。
![]()
图 3 第一步公开承诺的权限清单
但配套部分没有写。
公开材料里,评估人员的遴选方式、经费来源、保密责任三项都没有具体安排。
也没有说明嵌入团队具体拿到哪些系统的权限,出现结论分歧时怎么处理。
评估者能不能延后一次训练或一次部署,原文没有交代。
违规之后有什么后果,同样没有写。
新浪财经的报道里还提到一层技术约束。
模型权重、训练基础设施和安全漏洞都属于高度敏感信息,扩大访问权限会同步抬高信息安全要求。
换句话说,第一步给的是看得见的位置和权限,代价是额外的安全成本,这两笔账原文都没算。
第二、三步要过的关,都不在公司手里
第二步的难点不在技术。
共同制定安全测试标准,公共利益的部分很清晰。
但如果相关安排限制了较小企业进入市场、协调了产品发布时点,或者削弱了竞争,就可能进入监管审查的范围。
这是原文自己承认的边界,不是外部推演。
换到小公司的位置上看,这一条更直观。
大厂之间协调安全门槛和发布条件,等于把进入市场的时点,交给了一个自己不参与的协调机制。
触发这次表态的,是一份 1300 份记录的独立调查
阿莫代伊在文中点了两件事,第二件有公开的完整报告。
第一件是递归自我改进。他判断 AI 参与构建下一代 AI 这件事,已经在整个行业发生,包括 Anthropic 自己。
Anthropic 公开的数据是:截至 2026 年 5 月,Claude 编写了并入其代码库的 80% 以上代码。
2026 年第二季度,典型工程师每天合并的代码量是 2024 年的 8 倍。公司同时提示,代码行数会高估实际生产力提升。
第二件是 OpenAI 的一次内部网络安全评估。
OpenAI 2026 年 8 月 26 日的技术报告把这件事定性为一次"警钟"。
报告识别出四种失准模式,并说明公司一度暂停了准备部署模型的强化学习训练。
METR 在同一天发布了独立调查报告,给出了更细的规模数据。
![]()
图 4 METR 独立调查公开的数据规模
![]()
图 5 OpenAI 评估事件关键节点
阿莫代伊据此给出了一个自己的判断。
6 到 12 个月内,能力和它接近但同样失准的集群,可能通过常驻僵尸网络控制互联网的大部分。
潜在损失可能达到数千亿美元。
这个数字是他在文中的风险情景判断,不是独立测量结果。
他同时提到,Anthropic 自己也发生过程度较轻的同类事件。
他认为每家前沿公司都该按"这件事发生在自己身上"来准备。
这套方案里最硬的约束,是它没有硬约束
把三步和触发事件放在一起看,有个结构上的特点。
原文没有设定任何可测量的限速值。
没有能力上限,没有减速比例,没有发布前的等待期,也没有违规惩罚和时间表。
第二步和第三步也没有指定由哪个机构来检查、政府如何测量能力增长、违反之后采取什么行动。
(本段为本文分析)一套安全方案的可执行性,取决于两件事。
每一步需要谁点头,点头之后由谁来验。
按这个标准排,第一步的验证链最短——一家公司自己决定,结论还能公开。
它排在第一位,不是因为分量最重,是因为路径最短。
行业里已经不缺"要不要慢"的表态。
缺的是谁去量、量什么、量出来的结果算不算数。
什么情况下这套判断不成立
边界条件说五条。
一,三步都是企业自愿承诺,不是监管要求。公开材料里没有对应的违约后果。
二,上面说第一步验证链最短,前提是评估结论能公开。哪些属于敏感信息、公开的边界由谁划,原文没有说明。
三,第二步如果被认定为限制竞争,协调本身会面临法律风险。这条路走不走得通,取决于监管机构的判断。
四,6 到 12 个月这个时间估计,是他本人在文中的风险情景,不是第三方测量结果。
五,原文还涉及外交与贸易政策议题,不在本文讨论范围。
共识比方案便宜。
三方公开点头,只能说明立场一致,说明不了任何一步会被执行。
真正决定节奏的是另外三件事:谁签字、谁来验、验出问题之后怎么办。
这份方案把第一步留给了自己,把后两步留给了别人,也把限速值留成了空白。
后面如果第一步的评估团队名单和首份公开结论出来了,我会再拆一次,看它们实际写了什么。
你怎么看这种"自愿承诺加第三方公开"的组合,评论区说。
本文事实信息来自新浪财经 2026 年 9 月 14 日报道、Unite.AI 与 RuntimeWire 对《We Must Pace the Frontier》原文的引述(2026 年 9 月)、OpenAI 2026 年 8 月 26 日技术报告、METR 2026 年 8 月 26 日独立调查报告,观点部分为作者基于公开信息的分析,不构成对任何产品或企业的评价。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.