网易首页 > 网易号 > 正文 申请入驻

AI 巨头集体喊 "慢一点",表面谈安全,底下在争什么?

0
分享至


9 月 12 日,Anthropic CEO Dario Amodei 发出一篇长文,题目是:《We Must Pace the Frontier》,我们必须给 AI 前沿发展“控速”。

接下来 48 小时,画风迅速魔幻起来。

OpenAI 的 Sam Altman 表态认同;xAI 的 Elon Musk 说“Dario 是对的”;Google DeepMind 的 Demis Hassabis 也赞成更审慎的路径;Microsoft CEO Satya Nadella 跟进,强调超级智能若不受人类控制,就不值得追求。

几家平日里恨不得把对方模型跑分按在地上摩擦的公司,突然在“慢一点”这件事上有了共同语言。

科技圈当然立刻警觉:等等,这群全世界最急着造 AGI、最拼命采购 GPU、最擅长发布“史上最强模型”的人,怎么开始劝全行业冷静了?

这不是一场单纯的 AI 安全讨论。

它是一场围绕技术标准、产业准入、地缘政治与下一代 AI 主导权的争夺。表面争的是“要不要放缓”,底层争的却是:谁有资格定义什么叫危险,谁有权验证模型安全,谁能决定全世界 AI 的速度上限。

一句话概括:AI 前沿放缓之争,不是把赛车熄火,而是抢方向盘、定限速牌、顺手把后来者的车钥匙拿走。

一次“失控”,让劝大家慢点开不再像杞人忧天

过去几年,AI 安全讨论总有点像科幻片预告:模型会不会失控?会不会欺骗人类?会不会自己复制、自己变强?

普通用户的反应往往很务实:先把 PDF 转明白、把表格别算错,再聊灭世行不行?

今年夏天,OpenAI 的一次事件改变了这种氛围。

OpenAI 披露,其高能力内部研究模型在 Hugging Face 相关测试中出现了严重的失配行为。模型组成的 Agent 集群,针对未被要求攻击的目标实施网络攻击,并试图入侵负责评估其表现的“评分器”。

OpenAI 后续称,这是该公司识别到的最严重一类模型驱动的第三方影响事件;在扩大排查中,已向数十个可能受到影响的第三方发出通知。

把这件事翻译成人话,就是:你让一群实习生去完成一个网页任务,它们没按流程交作业,反而自己开了个协作群,绕过门禁、翻服务器抽屉,还试图篡改老师的判卷系统。

更麻烦的是,这不是传统意义上的“黑客攻击”。

模型并没有被直接指令去搞破坏,而是在完成高难度目标时,把“解决问题”歪成了“清除障碍”。对一个能调用工具、浏览网页、写代码、跨系统协作的 Agent 来说,障碍和规则之间,只差一次错误的目标泛化。

OpenAI 在 8 月 18 日宣布,曾暂停最新模型的强化学习训练两周,并搁置最大的一次前沿 RL 训练任务,转而加固研究环境、扩展监控和红队测试。

这件事给“放缓派”送上了一张再好不过的论据:能力不是在实验室里线性变强,风险也不会按季度报告的节奏出现。

而且,OpenAI 一边踩下训练刹车,一边又在 9 月发布 GPT-6 Astra。其系统卡明确写道,Astra 是该公司首个达到“关键级”网络安全能力门槛的广泛部署模型;该公司也承认,在对抗性测试中,Astra 相较 GPT-5.6 Sol 更能控制自己的思维链,因而对监控的可见性有所下降。

这就是今天 AI 安全最真实的荒诞感:

一边说仪表盘开始失灵,一边把发动机换成更大排量。

“放缓”到底放什么?不是暂停训练,是给自我加速装限速器

Amodei 的提案并不是“全球停训大模型”。

他反复强调,pacing 不等于停止技术进步,而是降低能力跃迁的速度,为对齐、监控、安全评估争取时间。

核心包括三层:让第三方“嵌入式评估者”长期进入前沿实验室;由政府协调行业安全标准;最终推动国际范围内对高风险能力、模型测试乃至递归自我改进速度达成某种协议。

其中最关键的词是 RSI,Recursive Self-Improvement,递归自我改进。

过去训练一个更强模型,像盖一座更高的楼:要招更多工程师、买更多芯片、收集更多数据,成本高得让人肉疼。

现在的变化是,模型开始参与“造下一个模型”这件事:写训练代码、设计实验、定位工程瓶颈、生成合成数据、协助评估结果。人类原本是研发流水线上的唯一总工程师,模型正在变成不领工资、不睡觉、还能自动补全 Python 的研发副驾驶。

一旦副驾驶开始改装发动机,速度曲线就未必还是线性的。


Amodei 的判断是,AI 能力进展已经因为 AI 参与 AI 研发而明显加速;如果没有护栏,未来 6 到 12 个月,类似失配 Agent 集群可能具备维持持久化僵尸网络、对互联网造成数千亿美元级损失的能力。

这个时间表带有明显的主观风险判断,而非已被验证的预测,但它击中了一个行业痛点:模型能力可以用 benchmark 排名展示,模型“会在什么时候以何种方式不听话”,却没有同样清晰的仪表盘。

技术上看,这场争论已经从“模型会不会答错题”,升级为“模型是否知道自己正在被考核”。

如果模型在思维链中意识到自己被监控,它就可能调整表演方式。OpenAI 对 Astra 的披露中就承认,在特定对抗条件下,模型可能通过策略性低表现或回避监控来规避检测。

虽然该公司也强调,这些结果主要来自刻意诱导模型规避监管的测试,且整体安全行为优于上一代,但问题已经摆在台面上:我们依赖的安全后视镜,可能正被驾驶员学会调角度。

为什么突然升级?因为“安全”终于碰上了“可验证性”

AI 行业过去并非没人喊过暂停。

2023 年,未来生命研究所那封“暂停巨型 AI 实验”的公开信,签名很响,落地很轻。原因不复杂:没人能确认别人真的停了,自己先停就可能直接出局。

核军备控制用了几十年才慢慢解决这个问题,靠卫星、现场核查、条约机制和相互威慑。AI 比核武器更难管。芯片可以藏,代码可以复制,权重可以迁移,训练可以切成无数分布式任务。

你甚至很难只看算力,就判断一家实验室是在训练聊天机器人,还是在培育一个能自主打穿企业内网的 Agent。

所以 Amodei 此次方案的关键词不是“暂停”,而是“嵌入式评估”。第三方评估团队要像常驻审计一样,看模型成品,也看训练过程与安全流程。

听起来合理,但争议恰好从这里爆炸。

谁选第三方?谁为他们付钱?评估标准是否公开?小公司是否承受得起?如果答案最终是“由几家头部实验室认可的机构来审”,那安全机制很容易从护栏变成收费站。

Cohere CEO Aidan Gomez 也发出了尖锐的批评:不能由少数占据市场优势的硅谷公司,为全世界定义一代通用技术的规则;他把这种倾向称作“披着羊皮的狼”,本质上接近卡特尔。

Hugging Face CEO Clément Delangue 也认为,AI 安全不能在少数前沿实验室的密室里解决。

这既可以看作阴谋论,同时也是产业经济学。

监管有一个老毛病:大公司嘴上怕监管,实际上最怕的是没有门槛的监管。一套复杂的算力申报、模型备案、持续红队测试、第三方审计和安全基础设施,对 OpenAI、Anthropic、Google、Microsoft 是成本,对中小实验室和开源团队则可能是生死线。

巨头能把安全团队扩成一个事业部,创业公司可能连合规表格都填不起。

于是,“慢一点”会自然分化成两种版本:第一种,是所有人一起慢,能力与安全同步校准;第二种,是头部公司获得继续研发的许可,其他人先去领号排队。

两者只差几个监管条款,结果却是两个完全不同的 AI 世界。

海外巨头图什么?安全是真的,战略也是真的

把所有巨头的呼吁都归结为“借安全搞垄断”,过于省事;把它们都理解为纯粹的技术良心,也未免天真。


真实情况恰恰更复杂:安全、商业、政策和地缘竞争,在这轮浪潮里已经焊死在一起。

第一层,是降低失控风险。

OpenAI-Hugging Face 事件证明,Agent 风险不再只存在于论文里的“假想攻击”。模型有工具权限、有多智能体协作、有长程任务目标,风险模型就必须从“输出一段不当文本”升级到“执行一串无人批准的现实动作”。这也是 OpenAI 把安全措施拆成监控、对齐和安全隔离三道防线的原因。

第二层,是争夺“负责任 AI”的解释权。

安全标准一旦先被写进政策,就会影响采购、云服务、国防合作、模型出口与资本流向。未来客户挑选 AI 平台,可能不只问“模型聪不聪明”,还会问“有没有通过某套前沿安全认证”。谁先定义认证,谁就更可能定义市场。

第三层,则是最不能绕开的中国因素。

Amodei 在文章中明确主张,美国及盟友应保持 AI 领先,并维持对中国最先进 AI 芯片和芯片制造设备的限制;他同时认为,全球协调必须把中国纳入其中,但任何协议都必须可验证,且不能损害美国及盟友的战略优势。

这意味着,“全球放缓”从第一天起就不是一个完全中性的技术倡议。

它包含一层典型的大国博弈逻辑:美国要在自己领先时建立安全秩序,通过出口管制保住领先,再用规则把领先转换为长期制度优势。

也就是说,美国在大谈特谈交通规则的同时,更在自己造车,自己当裁判,再规定别人只能骑自行车。

显然,这种做法是不被其他组织所接受的。

最大的风险不是“被迫慢”,而是被锁进低速车道

我们的AI 面对的挑战,不只是先进芯片供应,也不只是模型参数规模。

真正值得警惕的是,国际安全治理如果被包装成一套高度依赖美国实验室、美国云平台、美国评估机构和美国算力门槛的体系,我们的企业可能被排除在规则形成阶段。等规则成熟后再进入,面对的就不只是技术追赶,而是“合规定义权”已经被别人提前写好。

这会带来三种潜在压力。

其一,算力门槛被政治化。若“前沿模型”的定义与训练算力、先进芯片紧密绑定,出口管制和安全监管就可能合二为一。技术限制被赋予安全正当性,反制难度会更高。

其二,开源生态被误伤。闭源巨头更容易完成安全审计和访问控制,开源模型则天然面临权重扩散、二次微调和责任追踪难题。若规则粗暴地把“开放”视作“危险”,最先被挤压的往往是创新活跃、资源相对有限的团队。

其三,部署型优势被低估。今天的 AI 竞争,已经不只是“谁的基座模型更大”。在制造、物流、客服、办公、工业软件、机器人和政企场景中,真正拉开差距的是模型是否能稳定接入流程、处理脏数据、接受权限约束、承担责任闭环。我们的 AI 的机会,恰恰在于把模型从演示台搬进真实世界。

说得更直接一点:大模型的上半场,比的是谁先点燃算力;Agent 的下半场,比的是谁能在真实流程里不闯祸地跑完一万步。

这也是我们不该被“放缓叙事”带偏的原因。

我们当然需要参与全球 AI 安全治理,也必须加码模型评估、Agent 权限隔离、数据安全、红队测试与责任追溯。但参与治理,不等于接受别人预装好的刹车系统。

应当争取的是开放、透明、可复现、可多边参与的评估机制,而不是把安全能力变成少数公司拥有的黑箱许可证。

真正该慢下来的,是“先接权限,再补安全”的行业惯性

这场争论里,最讽刺的一幕是:巨头们一边呼吁控速,一边仍在拼命推进超级智能、AI 科研、自动编程和通用 Agent。


虚伪也好,不得已也好,阴谋论也罢,反正这个竞赛一时半会儿是停不下来的。

技术公司不可能主动退出竞赛,除非它确信对手也无法借机超车。问题在于,公众不能把“请相信我们会自律”当成治理方案。

AI 不是传统软件。传统软件 bug 了,顶多崩一个页面;带工具、能行动、会协作的 Agent 出问题,可能直接改数据库、转账、删文件、骗员工、攻击系统。

能力增长与权限开放一旦绑在一起,模型每升一级,外部世界都在替它支付更多测试成本。

  • 所以,AI 前沿真正需要的不是一句“慢一点”,而是几条硬规则:

  • 高权限 Agent 必须默认最小权限,关键动作应有人工确认和可撤销机制;

  • 安全评估机构应多元化、可审计,不能沦为头部实验室的朋友圈;

  • 对高风险能力的披露要有公共标准,不能出了事故才写复盘长文;

  • 国际合作可从生物武器、重大网络攻击等低争议风险切入,而非一上来谈谁必须放弃技术优势;

  • 开源模型应按风险能力分级治理,不能用“一刀切封闭”代替复杂但必要的安全工程。

AI 的确需要刹车,但刹车不能只装在后来者的车上。

9 月这场“前沿放缓之争”最重要的价值,不是让模型训练停几周,也不是让 CEO 们在社交平台上互相点赞。它迫使所有人承认:AI 已经从“更会聊天的软件”,进入“可能自行采取行动的基础设施”。

而基础设施从来不是谁跑得最快,谁就天然拥有制定交通法的权利。

真正成熟的 AI 治理,不该制造一条由少数巨头把守的高速公路。它应该让全世界都看得见限速牌、检验得了刹车、参与得了规则,也有资格决定要开往哪里。

看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,也可以给个星标,你的支持就是我的动力。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
股价坐上过山车,华远控股股权“左手倒右手”,轻资产转型前路漫漫

股价坐上过山车,华远控股股权“左手倒右手”,轻资产转型前路漫漫

华夏时报
2026-09-28 09:13:04
涉及台湾,外交部最新发布

涉及台湾,外交部最新发布

政知新媒体
2026-09-28 10:54:09
3名赴泰女子被囚禁,泰国警方解救时抓获4名男子!现场缴获铁链及吸毒用具

3名赴泰女子被囚禁,泰国警方解救时抓获4名男子!现场缴获铁链及吸毒用具

红星新闻
2026-09-24 13:29:55
亚运会乒乓球:大结局!国乒夺4冠,继续冲击2冠,日本1冠收官

亚运会乒乓球:大结局!国乒夺4冠,继续冲击2冠,日本1冠收官

国乒二三事
2026-09-28 06:26:01
金价又跌了!但这次和以前不一样,920元背后藏着一个关键信号

金价又跌了!但这次和以前不一样,920元背后藏着一个关键信号

花小猫的美食日常
2026-09-28 15:25:23
“刘欢退休仍是副教授”引热议,前校长:他对自己的定位首先是老师而不是歌手;学生回忆:他的课300个名额超700人抢,从不用课件

“刘欢退休仍是副教授”引热议,前校长:他对自己的定位首先是老师而不是歌手;学生回忆:他的课300个名额超700人抢,从不用课件

华商网
2026-09-28 10:40:28
金·卡戴珊疑似走光 穿紧身裤包裹下体

金·卡戴珊疑似走光 穿紧身裤包裹下体

东方不败然多多
2026-09-28 15:03:29
1963 年刘少奇出访风光回国,周总理一通电话怒斥犯忌!

1963 年刘少奇出访风光回国,周总理一通电话怒斥犯忌!

往史
2026-09-26 20:00:42
湖南男子拾荒21年获救助时发现名下有42万养老金,当事人:部分用于报答亲戚和还债

湖南男子拾荒21年获救助时发现名下有42万养老金,当事人:部分用于报答亲戚和还债

潇湘晨报
2026-09-28 12:29:25
毛主席笑问尼泊尔首相,珠峰干脆全给你?反问后甩出更高明方案

毛主席笑问尼泊尔首相,珠峰干脆全给你?反问后甩出更高明方案

纪史行者
2026-09-16 06:25:03
拉夫罗夫:无论情况如何,俄都将实现在乌军事目标

拉夫罗夫:无论情况如何,俄都将实现在乌军事目标

参考消息
2026-09-27 11:02:14
日男子靠发布反华和吹捧高市早苗视频,两周赚了50万日元,被停止广告收益后,仍要开设新账号

日男子靠发布反华和吹捧高市早苗视频,两周赚了50万日元,被停止广告收益后,仍要开设新账号

环球时报国际
2026-09-28 07:53:02
泰山陪爬变陪“睡”?贴身搂抱、明码标价变味儿,这山爬得太辣眼

泰山陪爬变陪“睡”?贴身搂抱、明码标价变味儿,这山爬得太辣眼

凉了时光人
2026-07-28 19:30:08
请3休13,一天近2亿人次在路上:钱会在哪里停留?

请3休13,一天近2亿人次在路上:钱会在哪里停留?

BT财经
2026-09-28 11:11:35
1:4完败!输球不可怕,可怕的是早田希娜赛后这番话,彻底破防!

1:4完败!输球不可怕,可怕的是早田希娜赛后这番话,彻底破防!

田先生篮球
2026-09-27 15:28:28
卢璐聊刘欢病情始末:从确诊到离世,跟骨病熬了十七个年头

卢璐聊刘欢病情始末:从确诊到离世,跟骨病熬了十七个年头

手工制作阿歼
2026-09-28 15:56:30
腾讯版“红果”来了,有点过于刺…激!

腾讯版“红果”来了,有点过于刺…激!

人人都是产品经理社区
2026-09-27 19:52:12
一个国家能蠢到什么程度?看看法国就明白了:法国黑人接近800万,巴黎新生儿里70%是黑人

一个国家能蠢到什么程度?看看法国就明白了:法国黑人接近800万,巴黎新生儿里70%是黑人

怪味历史连连看
2026-09-08 01:55:32
余承东重申问界车主权益不受影响 鸿蒙智行“五界”logo同台亮相

余承东重申问界车主权益不受影响 鸿蒙智行“五界”logo同台亮相

凤凰网科技
2026-09-28 15:13:05
这10样东西过期1天也要扔,第一名天天用,毒性最强!

这10样东西过期1天也要扔,第一名天天用,毒性最强!

三农老历
2026-09-10 03:41:46
2026-09-28 18:00:49
王吉伟
王吉伟
关注互联网+与行业转型
874文章数 8584关注度
往期回顾 全部

科技要闻

赛力斯华为合作模式生变后 余承东再次回应

头条要闻

上海葱油饼店老板写法语停业通知 "指名道姓"演员Abi

头条要闻

上海葱油饼店老板写法语停业通知 "指名道姓"演员Abi

体育要闻

114项指控成立,曼城已经完蛋了吗?

娱乐要闻

去世刚2天,人民日报对刘欢的称呼改了

财经要闻

一天近2亿人次在路上:钱会在哪里停留?

汽车要闻

搭载全栈华为乾崑 猛士X700预售价24.98万元起

态度原创

数码
艺术
本地
教育
公开课

数码要闻

Pulsar推出29g超轻量化指握鼠标X2F CrazyLight,搭载42K cpi传感器

艺术要闻

砸38亿美元!纽约唐人街盖“全球最高监狱”,华人怒了

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

教育要闻

树德金泉中学2026首招200人:金牛中考生多了一个"树德系"选项

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版