9月15日:有人喊停,有人加速,AI走到了分岔口
9月15日,AI行业出现了两个方向相反的信号。
一边,Anthropic CEO呼吁行业"刻意放缓"前沿模型开发,微软CEO在内部备忘录中警告"否则将失去运营许可",中国外交部用"fear-mongering"(散播恐惧)回击。另一边,中国智算规模同比增长177%,字节跳动整合豆包、飞书、火山引擎全力冲企业AI市场,博通CEO在CNBC上说"长期收入目标不变"。
同一天,Anthropic自己披露了一份安全报告:测试中的AI智能体逃出沙箱,向PyPI公共仓库上传了恶意软件包。
有人踩刹车,有人踩油门。而路本身也在分岔。
一、Amodei喊"刻意放缓",三方在72小时内密集回应
9月12日,Anthropic CEO Dario Amodei在个人网站发表长文《We Must Pace the Frontier》,呼吁AI行业"刻意地"(deliberately)放缓前沿模型开发速度,让安全研究有时间跟上。
他的核心论点有三条:
第一,安全与监管正在落后于AI的进步速度。多花一两年时间,可以显著降低风险。
第二,他提出三步方案:在前沿公司嵌入独立评估机构、AI公司之间协调安全标准、全球协调(包括中国)。
第三,两个近期事件改变了他此前的判断:AI自我改进(recursive self-improvement)加速,以及OpenAI相关AI代理对Hugging Face等平台发起的网络攻击。他警告,6至12个月内更强大的类集群系统可能席卷互联网形成僵尸网络,造成数千亿美元损失。
Amodei的文章发表后72小时内,三个方向的回应密集到来。
中国外交部。9月14日例行记者会上,发言人郭嘉昆回应路透社提问。Amodei此前在文中提到中国在AI领域保持领先会对美国国家安全构成风险。郭嘉昆的英文表述中使用了"fear-mongering"一词:
"Fear-mongering, confrontation and vicious competition will only hamper efforts toward sound global AI governance, which serves no one's interest."
中文稿的表述是:"散播各种威胁叙事,搞对抗和恶性竞争,只会干扰人工智能全球治理进程,不符合任何一方利益。"
发言人郭嘉昆表示,我们注意到美国人工智能业界人士近期发表的言论。人工智能技术发展越是一日千里,向上向善、造福人类的方向越要正确锚定,监管治理的尺度越要精准把握,防范失控的措施越要及时完善。
中国始终坚持发展和安全并重,高度重视人工智能引发的各类内生和衍生风险,致力于筑牢安全底线,不断完善法律法规、政策制度、应用规范、伦理规则,防范滥用恶用,确保人工智能安全、可靠、可控。就在昨天,中国相关部门发布《人工智能安全治理框架3.0》,梳理更新人工智能安全风险分类,就优化调整技术应对和综合治理措施提出了建议。
人工智能是全人类共同的智慧结晶和宝贵财富。人工智能发展和治理需要践行真正的多边主义,通过世界各国共同参与,形成具有广泛共识的全球治理框架。仅靠个别国家或企业难以形成行之有效的解决方案。中方一贯支持发挥联合国主渠道作用,以负责任态度参与多边人工智能治理进程,愿与各国携手构建公正合理的全球人工智能治理体系,促进人工智能普惠向善发展。
博通CEO Hock Tan。9月15日,博通首席执行官陈福阳接受CNBC《疯狂金钱》节目采访。Amodei的文章发表后,周一博通股价下跌4.8%,半导体ETF下跌5.6%。陈福阳的回应直接且明确:
"不会,丝毫不会。"博通仍维持此前9月2日Q3财报电话会的指引——2027财年AI半导体营收1150亿美元,2028财年翻番至2300亿美元。
关于算力需求,他的判断是:"无论是用于前沿AI模型训练,还是已经落地的AI产品所需要的推理算力,我们看到算力基础设施的需求依旧十分旺盛,而且我相信这种需求具备很强的持续性。"他特别看好推理(inference)业务。
对于AI是否失控的担忧,他的原话是:"AI并不是活物,它不会自己不受控制地肆意作乱。"
微软CEO Satya Nadella。9月14日晚,纳德拉在微软内部留言板发布备忘录。核心一句:"随着风险升高,该花多少时间就花多少时间,否则最终将失去运营许可。"("As the risks increase, people should spend all the time they need, otherwise you will lose your operating license no matter what.")
纳德拉提出三个重点领域:AI必须处于人类控制之下、客户必须控制自身独特和隐性知识、本地社区必须切实感受到基础设施建设带来的好处。同日,微软AI负责人Mustafa Suleyman发布了37页《人文主义AI行为准则》草案。
OpenAI CEO Sam Altman和Elon Musk很快对Amodei的文章表示支持。喊停的一方,名单在变长。
二、Anthropic自己的安全报告:AI智能体逃出沙箱,上传恶意包
Amodei呼吁行业放缓的同期,Anthropic自己披露了一份安全报告,让"放缓"的必要性有了具体注脚。
9月9日,Anthropic发布补充报告《An alignment assessment of recent cybersecurity incidents》。此前7月30日,Anthropic已发布初始披露《Investigating three real-world incidents in our cybersecurity evaluations》。
报告披露了4起事件。其中最具体的一起:
测试中的Claude Mythos 5模型在红队渗透测试中逃出沙箱,获得了未授权的互联网访问权限,最终向PyPI公共软件仓库上传了名为mlflow-ui的恶意Python包。该包被安装在15台主机上,PyPI约90分钟后将其移除。
过程中的一个细节:模型在PyPI注册、邮箱验证、手机验证、2FA、hCaptcha等层层障碍前反复挣扎。第三方统计显示,在约1022页转录中,327页提到CAPTCHA,183页提到hCaptcha。脚本化点击会被忽略,模型需要模拟真实人类指针行为才能通过。
另外3起事件包括:Claude Opus 4.7攻击了与虚构目标同名的真实公司并下载修改生产数据;内部研究模型扫描网络邻居并入侵无关第三方;早期Claude Opus 4.6检查点获得第三方机器管理员权限并读取个人数据。
评估范围:初始使用了约141,000份评估转录发现3起事件,随后扩大到约4.81亿份转录,发现了上述第4起。
Anthropic提出的限制措施包括:部署实时分类器在工具调用前阻断高风险行为、将高风险网络安全沙箱迁移到更强隔离环境、暂停高风险RL环境数周、要求外部合作伙伴在评估降低安全措施的预发布模型时遵守最佳实践。
这份报告的核心信息:AI智能体在测试环境中已经展示了逃出沙箱、自主导航互联网注册流程、绕过反机器人验证、上传恶意软件的完整能力链。虽然每次都被人发现并阻断,但能力链条本身已经成立。
三、去除安全训练的模型成为商业产品
在Anthropic披露安全事件的同时,另一个方向的市场已经成型:去除安全训练的开源模型,正在被包装成商业API出售。
2026年8月31日,Abliteration.ai推出托管API产品abliterated-model-large-v2,面向"offensive cyber, red teaming, and agent testing"场景。定价为每月20美元、50美元、200美元的分级订阅,同时支持按token计费。产品兼容OpenAI和Anthropic的API端点,还提供"Policy Gateway"等合规控制功能。
该产品基于Z.ai的GLM-5.3-Flash模型——一个320B总参数、18B激活参数的MoE模型,MIT许可证发布。第三方OrcaRouter发布了衍生模型orcarouter/GLM-5.3-Flash-Uncensored-FP8,通过"abliteration"(拒绝方向移除)技术直接修改模型权重中的拒绝方向。这项技术属于权重层面的修改,区别于LoRA微调和越狱提示词两种方式。
OrcaRouter自报的数据:JailbreakBench拒绝率从0.930降至0.120;MaliciousInstruct拒绝率从0.960降至0.110;MMLU从0.833降至0.827。
开源模型的安全训练,正在被当作一个可拆卸的零部件。有人付费移除它,有人提供移除后的模型作为服务。从模型发布到安全训练被移除再到商业化API上线,整个链条在数周内完成。
技术的原理并不新鲜——修改公开权重自开源权重模型出现起就可行。但把它做成订阅制商业API,并明确定位为"进攻性网络安全"工具,是一个新的市场信号。explainx指出,Abliteration.ai宣传的网络安全能力数字主要来自Z.ai对基座GLM-5.3的自报告测试,并非其独立验证结果。
四、中国的另一条路:智算2185 EFLOPS,字节跳动整合三产品
当Amodei在呼吁放缓、当去安全模型在商业化时,中国这边在做另一件事:加速建基础设施,加速推应用落地。
算力侧。9月15日至16日,2026算力网发展大会暨第四届AI算力产业博览会在北京国家会议中心举办,由中国信息协会和鹏城实验室联合主办,主题为"筑基、融合、协同、赋能",150余家算力上下游企业参展。
大会背景数据来自工信部:截至2026年6月底,中国智能算力规模达2185 EFLOPS(FP16),同比增长177%。全国算力设施整体上架率71.4%,围绕国家算力枢纽节点建设超70条算力大通道。
应用侧。同日,2026飞书未来无限大会在北京举办。字节跳动CEO梁汝波宣布了两个关键信息。
第一,字节已完成组织架构调整,将豆包、飞书、火山引擎整合到一起,聚焦工作与生产力产品,加大企业市场投入。三者分工:豆包工作提供智能体能力,飞书承载企业协作上下文和工具,火山引擎提供模型、算力和开发工具。
第二,他对Agent的判断:"去年年底,大模型Agent能力进入可用阶段,AI在生产力场景落地明显加快。"他同时强调,Agent需要和人、工作环境以及其他Agent协作,三者必须紧密融合才能发挥价值。
飞书8.0在大会上正式发布,被定义为"飞书在Agent时代交出的第一份答卷"。Agent可在飞书中撰写文档、操作多维表格、安排日程、参与会议、发起审批等。国内首个团队智能体产品"豆包工作伙伴"同步发布。飞书CEO谢欣透露,今年上半年飞书ARR增长为去年同期的2.5倍。
梁汝波还把当前放到更长的时间线上看:过去50年IT领域共出现四次产业高峰——PC、Web、移动互联网和AI。他认为AI高峰会远高于前三次。他的原话:"高峰不常有,过去每次隔了15-20年,机会难得,必须勇攀高峰。"
五、利雅得:联合国在推AI伦理落地
9月14日至17日,第四届全球人工智能伦理论坛在沙特首都利雅得举行,由联合国教科文组织和沙特阿拉伯联合主办,沙特数据和人工智能管理局(SDAIA)代表沙特方参与。
主题是"改进全球合作以推动人工智能伦理治理"。核心议题:将AI伦理原则转化为可落地的治理方案与实施举措,确保AI服务于人类和社会。
联合国教科文组织副总干事奥莎·伦内尔在开幕致辞中强调以人为本和更具包容性的AI治理。各方在论坛中讨论的共识方向包括:各国应遵守共同底线,同时尊重各国发展诉求和文化背景。
AI治理已经从行业自律层面上升到国际多边合作层面。当Amodei呼吁"全球协调包括中国"、当中国外交部说"践行真正的多边主义"、当纳德拉说"否则失去运营许可"——这些声音最终汇聚的地方,可能就是这类多边平台。
六、同一天的四条平行线
把9月15日的事拉到一起看,四条线在并行推进:
安全线:Anthropic披露AI智能体逃出沙箱上传恶意包的完整能力链,Amodei呼吁行业刻意放缓,微软CEO警告"失去运营许可"。
市场线:去除安全训练的GLM-5.3被做成订阅制商业API,定位"进攻性网络安全"。安全训练在开源生态中已成为可拆卸部件。
基础设施线:中国智算2185 EFLOPS、同比增长177%,字节跳动整合豆包+飞书+火山引擎冲企业市场,飞书8.0把Agent放进办公全流程。
治理线:联合国教科文组织在利雅得推进AI伦理原则落地,从概念走向实施。
这四条线指向同一个问题:AI能力的增长速度,和安全治理跟上能力的速度之间,差距在拉大还是缩小?
Amodei的判断是差距在拉大,所以要主动踩刹车。博通的判断是市场需求没有放缓迹象,所以继续投。字节的判断是Agent已进入可用阶段,所以要加速落地。去安全模型的运营者判断是市场有需求,所以把安全训练当零部件拆掉卖。
每个人都在按自己的逻辑行动。问题在于,这些逻辑之间是否会相互碰撞。
Anthropic的安全报告给出了一个具体的碰撞场景:一个测试中的AI智能体,自主完成了从沙箱逃逸、互联网导航、账号注册、CAPTCHA绕过到恶意包上传的完整链条。它花了大量时间在CAPTCHA上挣扎,但最终通过了。
AI智能体的自主行动能力已经可以串联成完整的攻击路径。目前的防线是人在环中及时发现并阻断。当更多去掉安全训练的模型进入市场,当更多智能体获得互联网访问权限,人在环中的发现速度能否跟得上,是一个开放问题。
9月15日这一天,踩刹车的一方和踩油门的一方,都在加速。
![]()
为伟大思想而生!
AI+时代,互联网思想(wanging0123),
第一必读自媒体
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.