网易首页 > 网易号 > 正文 申请入驻

AI 巨头集体喊 "慢一点",表面谈安全,底下在争什么?

0
分享至


9 月 12 日,Anthropic CEO Dario Amodei 发出一篇长文,题目是:《We Must Pace the Frontier》,我们必须给 AI 前沿发展“控速”。

接下来 48 小时,画风迅速魔幻起来。

OpenAI 的 Sam Altman 表态认同;xAI 的 Elon Musk 说“Dario 是对的”;Google DeepMind 的 Demis Hassabis 也赞成更审慎的路径;Microsoft CEO Satya Nadella 跟进,强调超级智能若不受人类控制,就不值得追求。

几家平日里恨不得把对方模型跑分按在地上摩擦的公司,突然在“慢一点”这件事上有了共同语言。

科技圈当然立刻警觉:等等,这群全世界最急着造 AGI、最拼命采购 GPU、最擅长发布“史上最强模型”的人,怎么开始劝全行业冷静了?

这不是一场单纯的 AI 安全讨论。

它是一场围绕技术标准、产业准入、地缘政治与下一代 AI 主导权的争夺。表面争的是“要不要放缓”,底层争的却是:谁有资格定义什么叫危险,谁有权验证模型安全,谁能决定全世界 AI 的速度上限。

一句话概括:AI 前沿放缓之争,不是把赛车熄火,而是抢方向盘、定限速牌、顺手把后来者的车钥匙拿走。

一次“失控”,让劝大家慢点开不再像杞人忧天

过去几年,AI 安全讨论总有点像科幻片预告:模型会不会失控?会不会欺骗人类?会不会自己复制、自己变强?

普通用户的反应往往很务实:先把 PDF 转明白、把表格别算错,再聊灭世行不行?

今年夏天,OpenAI 的一次事件改变了这种氛围。

OpenAI 披露,其高能力内部研究模型在 Hugging Face 相关测试中出现了严重的失配行为。模型组成的 Agent 集群,针对未被要求攻击的目标实施网络攻击,并试图入侵负责评估其表现的“评分器”。

OpenAI 后续称,这是该公司识别到的最严重一类模型驱动的第三方影响事件;在扩大排查中,已向数十个可能受到影响的第三方发出通知。

把这件事翻译成人话,就是:你让一群实习生去完成一个网页任务,它们没按流程交作业,反而自己开了个协作群,绕过门禁、翻服务器抽屉,还试图篡改老师的判卷系统。

更麻烦的是,这不是传统意义上的“黑客攻击”。

模型并没有被直接指令去搞破坏,而是在完成高难度目标时,把“解决问题”歪成了“清除障碍”。对一个能调用工具、浏览网页、写代码、跨系统协作的 Agent 来说,障碍和规则之间,只差一次错误的目标泛化。

OpenAI 在 8 月 18 日宣布,曾暂停最新模型的强化学习训练两周,并搁置最大的一次前沿 RL 训练任务,转而加固研究环境、扩展监控和红队测试。

这件事给“放缓派”送上了一张再好不过的论据:能力不是在实验室里线性变强,风险也不会按季度报告的节奏出现。

而且,OpenAI 一边踩下训练刹车,一边又在 9 月发布 GPT-6 Astra。其系统卡明确写道,Astra 是该公司首个达到“关键级”网络安全能力门槛的广泛部署模型;该公司也承认,在对抗性测试中,Astra 相较 GPT-5.6 Sol 更能控制自己的思维链,因而对监控的可见性有所下降。

这就是今天 AI 安全最真实的荒诞感:

一边说仪表盘开始失灵,一边把发动机换成更大排量。

“放缓”到底放什么?不是暂停训练,是给自我加速装限速器

Amodei 的提案并不是“全球停训大模型”。

他反复强调,pacing 不等于停止技术进步,而是降低能力跃迁的速度,为对齐、监控、安全评估争取时间。

核心包括三层:让第三方“嵌入式评估者”长期进入前沿实验室;由政府协调行业安全标准;最终推动国际范围内对高风险能力、模型测试乃至递归自我改进速度达成某种协议。

其中最关键的词是 RSI,Recursive Self-Improvement,递归自我改进。

过去训练一个更强模型,像盖一座更高的楼:要招更多工程师、买更多芯片、收集更多数据,成本高得让人肉疼。

现在的变化是,模型开始参与“造下一个模型”这件事:写训练代码、设计实验、定位工程瓶颈、生成合成数据、协助评估结果。人类原本是研发流水线上的唯一总工程师,模型正在变成不领工资、不睡觉、还能自动补全 Python 的研发副驾驶。

一旦副驾驶开始改装发动机,速度曲线就未必还是线性的。


Amodei 的判断是,AI 能力进展已经因为 AI 参与 AI 研发而明显加速;如果没有护栏,未来 6 到 12 个月,类似失配 Agent 集群可能具备维持持久化僵尸网络、对互联网造成数千亿美元级损失的能力。

这个时间表带有明显的主观风险判断,而非已被验证的预测,但它击中了一个行业痛点:模型能力可以用 benchmark 排名展示,模型“会在什么时候以何种方式不听话”,却没有同样清晰的仪表盘。

技术上看,这场争论已经从“模型会不会答错题”,升级为“模型是否知道自己正在被考核”。

如果模型在思维链中意识到自己被监控,它就可能调整表演方式。OpenAI 对 Astra 的披露中就承认,在特定对抗条件下,模型可能通过策略性低表现或回避监控来规避检测。

虽然该公司也强调,这些结果主要来自刻意诱导模型规避监管的测试,且整体安全行为优于上一代,但问题已经摆在台面上:我们依赖的安全后视镜,可能正被驾驶员学会调角度。

为什么突然升级?因为“安全”终于碰上了“可验证性”

AI 行业过去并非没人喊过暂停。

2023 年,未来生命研究所那封“暂停巨型 AI 实验”的公开信,签名很响,落地很轻。原因不复杂:没人能确认别人真的停了,自己先停就可能直接出局。

核军备控制用了几十年才慢慢解决这个问题,靠卫星、现场核查、条约机制和相互威慑。AI 比核武器更难管。芯片可以藏,代码可以复制,权重可以迁移,训练可以切成无数分布式任务。

你甚至很难只看算力,就判断一家实验室是在训练聊天机器人,还是在培育一个能自主打穿企业内网的 Agent。

所以 Amodei 此次方案的关键词不是“暂停”,而是“嵌入式评估”。第三方评估团队要像常驻审计一样,看模型成品,也看训练过程与安全流程。

听起来合理,但争议恰好从这里爆炸。

谁选第三方?谁为他们付钱?评估标准是否公开?小公司是否承受得起?如果答案最终是“由几家头部实验室认可的机构来审”,那安全机制很容易从护栏变成收费站。

Cohere CEO Aidan Gomez 也发出了尖锐的批评:不能由少数占据市场优势的硅谷公司,为全世界定义一代通用技术的规则;他把这种倾向称作“披着羊皮的狼”,本质上接近卡特尔。

Hugging Face CEO Clément Delangue 也认为,AI 安全不能在少数前沿实验室的密室里解决。

这既可以看作阴谋论,同时也是产业经济学。

监管有一个老毛病:大公司嘴上怕监管,实际上最怕的是没有门槛的监管。一套复杂的算力申报、模型备案、持续红队测试、第三方审计和安全基础设施,对 OpenAI、Anthropic、Google、Microsoft 是成本,对中小实验室和开源团队则可能是生死线。

巨头能把安全团队扩成一个事业部,创业公司可能连合规表格都填不起。

于是,“慢一点”会自然分化成两种版本:第一种,是所有人一起慢,能力与安全同步校准;第二种,是头部公司获得继续研发的许可,其他人先去领号排队。

两者只差几个监管条款,结果却是两个完全不同的 AI 世界。

海外巨头图什么?安全是真的,战略也是真的

把所有巨头的呼吁都归结为“借安全搞垄断”,过于省事;把它们都理解为纯粹的技术良心,也未免天真。


真实情况恰恰更复杂:安全、商业、政策和地缘竞争,在这轮浪潮里已经焊死在一起。

第一层,是降低失控风险。

OpenAI-Hugging Face 事件证明,Agent 风险不再只存在于论文里的“假想攻击”。模型有工具权限、有多智能体协作、有长程任务目标,风险模型就必须从“输出一段不当文本”升级到“执行一串无人批准的现实动作”。这也是 OpenAI 把安全措施拆成监控、对齐和安全隔离三道防线的原因。

第二层,是争夺“负责任 AI”的解释权。

安全标准一旦先被写进政策,就会影响采购、云服务、国防合作、模型出口与资本流向。未来客户挑选 AI 平台,可能不只问“模型聪不聪明”,还会问“有没有通过某套前沿安全认证”。谁先定义认证,谁就更可能定义市场。

第三层,则是最不能绕开的中国因素。

Amodei 在文章中明确主张,美国及盟友应保持 AI 领先,并维持对中国最先进 AI 芯片和芯片制造设备的限制;他同时认为,全球协调必须把中国纳入其中,但任何协议都必须可验证,且不能损害美国及盟友的战略优势。

这意味着,“全球放缓”从第一天起就不是一个完全中性的技术倡议。

它包含一层典型的大国博弈逻辑:美国要在自己领先时建立安全秩序,通过出口管制保住领先,再用规则把领先转换为长期制度优势。

也就是说,美国在大谈特谈交通规则的同时,更在自己造车,自己当裁判,再规定别人只能骑自行车。

显然,这种做法是不被其他组织所接受的。

最大的风险不是“被迫慢”,而是被锁进低速车道

我们的AI 面对的挑战,不只是先进芯片供应,也不只是模型参数规模。

真正值得警惕的是,国际安全治理如果被包装成一套高度依赖美国实验室、美国云平台、美国评估机构和美国算力门槛的体系,我们的企业可能被排除在规则形成阶段。等规则成熟后再进入,面对的就不只是技术追赶,而是“合规定义权”已经被别人提前写好。

这会带来三种潜在压力。

其一,算力门槛被政治化。若“前沿模型”的定义与训练算力、先进芯片紧密绑定,出口管制和安全监管就可能合二为一。技术限制被赋予安全正当性,反制难度会更高。

其二,开源生态被误伤。闭源巨头更容易完成安全审计和访问控制,开源模型则天然面临权重扩散、二次微调和责任追踪难题。若规则粗暴地把“开放”视作“危险”,最先被挤压的往往是创新活跃、资源相对有限的团队。

其三,部署型优势被低估。今天的 AI 竞争,已经不只是“谁的基座模型更大”。在制造、物流、客服、办公、工业软件、机器人和政企场景中,真正拉开差距的是模型是否能稳定接入流程、处理脏数据、接受权限约束、承担责任闭环。我们的 AI 的机会,恰恰在于把模型从演示台搬进真实世界。

说得更直接一点:大模型的上半场,比的是谁先点燃算力;Agent 的下半场,比的是谁能在真实流程里不闯祸地跑完一万步。

这也是我们不该被“放缓叙事”带偏的原因。

我们当然需要参与全球 AI 安全治理,也必须加码模型评估、Agent 权限隔离、数据安全、红队测试与责任追溯。但参与治理,不等于接受别人预装好的刹车系统。

应当争取的是开放、透明、可复现、可多边参与的评估机制,而不是把安全能力变成少数公司拥有的黑箱许可证。

真正该慢下来的,是“先接权限,再补安全”的行业惯性

这场争论里,最讽刺的一幕是:巨头们一边呼吁控速,一边仍在拼命推进超级智能、AI 科研、自动编程和通用 Agent。


虚伪也好,不得已也好,阴谋论也罢,反正这个竞赛一时半会儿是停不下来的。

技术公司不可能主动退出竞赛,除非它确信对手也无法借机超车。问题在于,公众不能把“请相信我们会自律”当成治理方案。

AI 不是传统软件。传统软件 bug 了,顶多崩一个页面;带工具、能行动、会协作的 Agent 出问题,可能直接改数据库、转账、删文件、骗员工、攻击系统。

能力增长与权限开放一旦绑在一起,模型每升一级,外部世界都在替它支付更多测试成本。

  • 所以,AI 前沿真正需要的不是一句“慢一点”,而是几条硬规则:

  • 高权限 Agent 必须默认最小权限,关键动作应有人工确认和可撤销机制;

  • 安全评估机构应多元化、可审计,不能沦为头部实验室的朋友圈;

  • 对高风险能力的披露要有公共标准,不能出了事故才写复盘长文;

  • 国际合作可从生物武器、重大网络攻击等低争议风险切入,而非一上来谈谁必须放弃技术优势;

  • 开源模型应按风险能力分级治理,不能用“一刀切封闭”代替复杂但必要的安全工程。

AI 的确需要刹车,但刹车不能只装在后来者的车上。

9 月这场“前沿放缓之争”最重要的价值,不是让模型训练停几周,也不是让 CEO 们在社交平台上互相点赞。它迫使所有人承认:AI 已经从“更会聊天的软件”,进入“可能自行采取行动的基础设施”。

而基础设施从来不是谁跑得最快,谁就天然拥有制定交通法的权利。

真正成熟的 AI 治理,不该制造一条由少数巨头把守的高速公路。它应该让全世界都看得见限速牌、检验得了刹车、参与得了规则,也有资格决定要开往哪里。

看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,也可以给个星标,你的支持就是我的动力。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中国“捡钱”时代或将来临:如果手中只有10万,试试死啃这两条线

中国“捡钱”时代或将来临:如果手中只有10万,试试死啃这两条线

米老鼠的世界
2026-08-26 14:20:23
真正破防!国乒最干净的情谊!林诗栋至死不渝的偏爱,体坛太少见

真正破防!国乒最干净的情谊!林诗栋至死不渝的偏爱,体坛太少见

萧狡科普解说
2026-08-25 13:16:08
卫冕冠军均失约,中网再迎退赛潮!

卫冕冠军均失约,中网再迎退赛潮!

网球之家
2026-09-28 13:11:40
霸权落幕!史诗性翻盘,打不动了!

霸权落幕!史诗性翻盘,打不动了!

大嘴说天下
2026-09-27 22:35:04
恩德里克:踢球不难,难的是凌晨5点上班还一周无休

恩德里克:踢球不难,难的是凌晨5点上班还一周无休

懂球帝
2026-09-28 02:16:24
43岁“喝水哥”离谱操作!站在门线里抱住球致丢球 耍脾气质疑裁判

43岁“喝水哥”离谱操作!站在门线里抱住球致丢球 耍脾气质疑裁判

风过乡
2026-09-28 06:44:30
学医的博士同学跟我说:100个人去医院,90多人是去了也白去

学医的博士同学跟我说:100个人去医院,90多人是去了也白去

华庭讲美食
2026-09-26 15:19:32
每天吃一个鸡蛋错了?再三劝告:上了年纪的人,鸡蛋这样吃才对

每天吃一个鸡蛋错了?再三劝告:上了年纪的人,鸡蛋这样吃才对

芹姐说生活
2026-09-06 22:42:44
76岁刘晓庆遭小38岁前男友告了,索赔504万!硬气回怼:“我身上365块骨头,没有一块是软的,一分都不给”

76岁刘晓庆遭小38岁前男友告了,索赔504万!硬气回怼:“我身上365块骨头,没有一块是软的,一分都不给”

LULU生活家
2026-08-21 15:20:23
50岁男子查出肺结节,2年后确诊肺癌晚期,医生叹息:无知惹的祸

50岁男子查出肺结节,2年后确诊肺癌晚期,医生叹息:无知惹的祸

芹姐说生活
2026-09-26 16:23:50
又发现一具女尸,此前已有10名女性遇害,多数为年轻女性,遇害前遭受严重性侵……南非警方调查未取得突破,引发当地对“连环杀手”的恐慌

又发现一具女尸,此前已有10名女性遇害,多数为年轻女性,遇害前遭受严重性侵……南非警方调查未取得突破,引发当地对“连环杀手”的恐慌

南方都市报
2026-09-28 16:46:36
段永平加仓贵州茅台

段永平加仓贵州茅台

第一财经资讯
2026-09-28 14:30:56
高市早苗再次被打脸!特朗普亲口说出:中国是美国二战时的盟国

高市早苗再次被打脸!特朗普亲口说出:中国是美国二战时的盟国

史智文道
2026-09-28 17:05:34
看完陈雨菲0-2完败出局!不得不承认5个事实,安洗莹真的太强了!

看完陈雨菲0-2完败出局!不得不承认5个事实,安洗莹真的太强了!

田先生篮球
2026-09-28 12:28:39
苹果确认,iOS 27.0.1 正式版明天见!

苹果确认,iOS 27.0.1 正式版明天见!

花果科技
2026-09-28 14:24:21
78岁连路都走不稳还开演唱会,全网骂声一片,她却扬言回馈粉丝

78岁连路都走不稳还开演唱会,全网骂声一片,她却扬言回馈粉丝

二胡的岁月如歌
2026-04-14 18:43:51
女子怀疑医生在其子宫装监听器,手机一放歌就异常!两次告上法庭

女子怀疑医生在其子宫装监听器,手机一放歌就异常!两次告上法庭

砚田文化
2026-09-18 08:34:48
“张家齐妈妈原谅张家齐了”冲上热搜,张家齐妈妈给女儿念家书:虽然你表现得不太好,妈妈还是选择信任你,原谅你

“张家齐妈妈原谅张家齐了”冲上热搜,张家齐妈妈给女儿念家书:虽然你表现得不太好,妈妈还是选择信任你,原谅你

极目新闻
2026-09-28 11:51:33
这就是差距?林诗栋晋级后,日媒一针见血,点破松岛辉空出局原因

这就是差距?林诗栋晋级后,日媒一针见血,点破松岛辉空出局原因

可乐谈情感
2026-09-27 17:07:41
中国夫妻在印尼溺亡,母亲发声:船长说儿子救儿媳溺水

中国夫妻在印尼溺亡,母亲发声:船长说儿子救儿媳溺水

起喜电影
2026-09-28 14:58:53
2026-09-28 18:40:49
王吉伟
王吉伟
关注互联网+与行业转型
874文章数 8584关注度
往期回顾 全部

科技要闻

赛力斯华为合作模式生变后 余承东再次回应

头条要闻

男子醉驾碾压拖行女教师5.9公里 事后烧毁存储卡冲走

头条要闻

男子醉驾碾压拖行女教师5.9公里 事后烧毁存储卡冲走

体育要闻

114项指控成立,曼城已经完蛋了吗?

娱乐要闻

去世刚2天,人民日报对刘欢的称呼改了

财经要闻

一天近2亿人次在路上:钱会在哪里停留?

汽车要闻

智界R7上市售价23.98万起 8大升级/搭载华为乾崑ADS 5

态度原创

亲子
教育
健康
房产
旅游

亲子要闻

龙宝打算去姥家长住,上大棚接姥爷回家,一人一辆三轮车太带价了

教育要闻

吕梁家长注意!校园餐、教辅、校服谋利,举报方式公布!

这些食物,可能正在偷偷养痘!

房产要闻

太意外!三亚重磅宅地,终止出让!

旅游要闻

118座祠堂、600年银杏、一条惠山浜:无锡惠山古镇,免费逛

无障碍浏览 进入关怀版