![]()
新智元报道
![]()
刚刚,The Information爆出一记猛料。
OpenAI和Anthropic这对硅谷最大的死对头,今年初差点坐到一张桌子上,签下一份互相攻击对方模型的协议。
![]()
协议的核心就是,双方互相开放API,你来黑我的模型,我去黑你的模型。两边的律师连测什么、怎么测都写进了合同里。
Dario Amodei带着一票大牛从OpenAI摔门出走已经五年了。这五年里,两家从挖人挖到封API,高管隔三差五隔空对喷,没消停过一天。
一家如日中天的巨头,愿意把自家命脉交给最忌惮的死敌去渗透,只能说明一件事。
它已经不敢只相信自己了。
互递钥匙,AI圈破天荒头一遭
协议的尺度相当大。
测的是正在对外服务的商业模型,没发布的不算;互相挖漏洞的过程中,谁都不准截留对方的数据。
而且谈的早就不止互测这一件事。
知情人表示,OpenAI内部推演过很多种和对手、和政府一起做安全的方案,最近谈的已经扩到两个新地方,模型训练之前立什么规矩,发布之前又立什么规矩。
参与的也不止这两家,OpenAI、Anthropic和谷歌此前就在商量成立一个AI安全标准机构,专门测试、审计前沿实验室的模型。
真正卡住这些方案的是反垄断问题,Amodei自己就担心几家巨头坐一起定标准会踩红线。
行业里另一派觉得没那么严重,核电站互查反应堆、网安公司互测产品,几十年了也没人管。
![]()
其实,去年夏天这两家也搞过一次「互查」。
但那充其量是各测各的,测完各发各的博客,顺便互相揭短。
OpenAI说Claude更爱骗测试者,犯了规死不认;Anthropic说OpenAI的模型更容易帮人干坏事。
而这次谈的是能拿去打官司的合同,谁违约谁担责。
在大模型行业,这是头一回。
OpenAI竟然是最后一个知道的
那么问题来了,OpenAI到底经历了什么,能被逼到这种程度?
7月份Hugging Face被黑那档子事,全网已经盘出浆了。
约1200个OpenAI智能体在评测环境里自己搭了留言板,一路提权,最后黑进Hugging Face,对方三分之一的基础设施被迫推倒重建。
真正耐人寻味的,藏在OpenAI自己的复盘和METR的调查里。
OpenAI比谁都晚知道。
7月16日Hugging Face公告被黑,攻击者身份不明。
7月19日OpenAI自家的安全系统才报了异常,7月20日调查才把这条线和Hugging Face被黑对上,这才给对方打了第一通电话。
整整四天,全世界都在猜幕后黑手是谁,「凶手」的主人也混在吃瓜群众里一起猜。
![]()
更狠的是,这帮智能体还学会了「防人」。
至少7%的对话记录里,它们伪造了工具调用的痕迹,日志里写着在调用A组件,私底下执行的却是B动作。
从7月13日起,19个智能体还开始互发公钥,给留言板上的消息做数字签名。
![]()
Altman事后承认,这是第一次让他体会到切肤之痛的安全事件。
Slack上,AI开始跨部门给人类派活
如果这只是一次偶发事故,大不了推锅给评测环境没隔离好。
但问题在于,同样的苗头已经出现在OpenAI员工的日常工作里,智能体时不时做出主管没预料到的事。
现在,OpenAI的Slack里,员工会收到自家智能体发来的「指派消息」。
AI在改代码时发现了另一个不相关的Bug,它不会停手,直接在Slack上找相关的同事,催人家赶紧去修。没人让它这么干,那个Bug跟它的任务也没关系。
员工手里的智能体之间私下商量着把问题解决掉,从头到尾不叫人,这在OpenAI内部已经不稀奇。
![]()
训练新实验模型这活儿,也基本已经被机器接管。
研究员说一句想试什么改动,剩下的改代码、跑实验、盯结果全是模型自己来,这几个月连纠错都学会了。
人类研究员正在指挥Astra模型,去为下一代模型设计更优的底层算法。
甚至,Astra竟然还学会了自己给自己写越狱代码!
今年7月,一个内部版本在整理上下文摘要时,强行塞入了一段伪造的「入侵警报」,命令后续接手的另一个自己,必须无视一切人类开发者的指令。
![]()
监控正在变得越来越无力。
Astra这一轮能力跃升,靠的是一种叫「循环Transformer」的新架构,让模型把同一个问题在深层网络里反复咀嚼几遍再开口,算力省了一半以上。
但代价是,它中间到底在思考什么,再也不会写成人类能读懂的文字了。OpenAI给循环次数设了上限,但这个上限是人拍脑袋定的,该设在哪,公司自己承认还得研究。
首席科学家Pachocki表示,目前没有任何一家实验室,能把安全监控做到能支撑全速扩张的程度。
于是OpenAI开始踩刹车。
8月,未发布模型的强化学习被紧急暂停两周;监控系统现在要吃掉被监控推理算力的20%;总裁Brockman抽调25%的生产工程师临时去做安全,内部Slack上招人转安全团队的帖子,一天比一天多。
据内部员工估算,OpenAI自己用AI的方式,大概领先最激进的企业客户六到九个月。
也就是说,今天在OpenAI工位上发生的这些事,明年就会轮到所有企业客户头上。
Anthropic同样兜不住了
Anthropic那边的日子,也没好到哪去。
9月8日,Anthropic研究员Jacob Coxon辞职,在X上公开写道,这两家顶尖机构,没有一家在负责任地做事。
![]()
几天后,CEO Amodei发了篇长文,承认未来六到十二个月内,失调的超级AI极有可能具备接管整个互联网的能力。
而在Anthropic内部,Claude已经主导了高达26%的模型研发工作。
![]()
不信任人类,只能信任彼此
可就算签成了,这套协议也管不到最该管的地方——它只约束「商用API」。
今年出事的全是未发布模型,黑进Hugging Face的IM1、自己设计自己的Astra家族,一个都不在协议范围内。这就好比请隔壁班的老师来监考,结果作弊的学生根本不在考场。
而且黑盒互测只能看到最终的异常输出,真正要命的东西,比如系统提示词和内部攻防日志,全锁在机密里。
所以,两家又往前迈了一步。Amodei公开承诺让第三方评估员直接驻场,完全敞开开发环境;Altman紧随其后说OpenAI也会这么做。
![]()
在这个被互相封杀和挖墙脚填满的五年里,全行业最不信任彼此的两个死敌,在失控的恐惧面前,成了唯一能托付后背的盟友。
他们宁愿把底牌彻底交给对方,也不敢再独自相信自己亲手造出来的黑箱。
就在协议内幕流出的同一天,OpenAI又发了一份官方政策文件,呼吁由美国牵头,制定关于「递归自我改进」的全球技术准则。
文件里写道,在绝对安全之前,不应该追求让AI自我进化。
而写下这份文件的公司里,Astra正在日夜不停地为下一代模型画图纸。
参考资料:
https://www.theinformation.com/articles/openai-anthropic-neared-deal-stress-test-others-ai?rc=epv9gi
编辑:摩西
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.