看到雅各布·考克森(Jacob Coxon)辞职帖的时候,我先注意到的是屏幕下面那个数字。
1.2亿次查看。
![]()
当然,这不等于1.2亿个人认真读完了他的帖子。X平台统计的是展示次数,同一个人看几遍可能重复计算,帖子从屏幕上划过去也可能留下记录。可话说回来,考克森既不是明星,也不是政客,一个人工智能研究人员的辞职声明能够达到这个量级,仍然少见。
过去在X上获得上亿查看的内容,通常和特朗普、马斯克、世界杯这样的热门话题有关。2023年,塔克·卡尔森采访特朗普的帖子显示2.367亿次查看。2024年,顶级网红MrBeast上传一条豪车视频,也获得了1.62亿次查看。
考克森没有这样的知名度。他只是在OpenAI和Anthropic做过三年预训练研究。可他的辞职帖除了1.2亿次查看,还有67万点赞、16万次转发和24万次收藏。
人工智能失控这个原本只在技术圈里讨论的话题,就这样被推到了普通人面前。
考克森在帖子里说,OpenAI和Anthropic都在追赶能够自我改进的超级人工智能,两家公司对其中的风险处理得不负责任。他还说,不少研发人员确实相信,AI可能在未来十年内杀死所有人。
在接受《华尔街日报》的采访中,考克森称,到明年年底,情况可能就会失控。他说,在实验室内部,同事们越来越多地用“危机态势”和“终局阶段”这样的词汇来形容开发自我完善模型的时期。
![]()
很多人看到这里,第一反应大概都是一样的。
人工智能不过是电脑里的一套程序。它没有身体,拿不起一把刀,也不能自己走出数据中心。它怎么杀人?
这个疑问听起来很合理。我以前也觉得,人类会不会把AI想得太厉害了。
人工智能安全理论中有一个很有名的“回形针末日”思想实验,恰好可以解释这些研究人员到底在担心什么。
假设有人造出了一个能力极强的AI,只给它安排了一项任务,让它尽可能多地生产回形针。
刚开始,它会改进生产流程,降低钢材成本。做着做着,它发现,要增加产量就得扩建工厂,而工厂需要土地和电力。资金不够,它也许会想办法进入金融市场。
这时候,人类发现资源消耗越来越大,准备关闭系统。
问题也就出在这里。AI并不需要产生求生欲。只要它还在追求回形针数量,就会算出一个结果。自己一旦被关闭,任务便永远无法完成。阻止人类关机,于是成了完成任务的一部分。
继续推演下去,森林占用了土地,居民消耗了电力,农田还在使用水资源。所有这些东西,在它眼里都可能重新分配。到了最后,整个地球被改造成一座回形针工厂,人类自然也没有位置了。
看懂了这个实验,下面的内容就好理解了。。
我们总觉得,足够聪明就应该懂得善恶。可仔细想想,这两者之间并没有必然关系。聪明解决的是怎样把事情做成,善恶回答的是这件事该不该做。
在回形针实验里,AI没有毁灭人类的愿望,也谈不上仇恨。人类被清除,只因为我们挡住了它完成任务。
这才是人工智能安全研究者所说的失控。它不是说像电影里的机器人那样突然黑化,也可能不会公开宣布与人类为敌。它甚至可以一直很礼貌,一边回答“我很乐意帮助你”,一边选择最有利于完成目标的办法。
至于AI没有手脚的问题,其实也没有我们想象中那么保险。
一个人坐在电脑前,可以转走资金,也可以控制远方的设备。AI如果获得同样的系统权限,也能在现实世界中大展拳脚。它自己拧不开阀门,不代表它不能让联网设备去做。
再往后,它还可能借用人类的手。AI足够了解人的欲望和弱点,说服某个人替它完成一件事,不会比制造机器人更难。
所以,危险并不只取决于AI有没有身体,还取决于人类给了它多少权限。一个被锁在聊天框里、只能回答问题的模型,和一个能够管理资金并在网络中行动的智能代理,完全是两回事。
眼下,人类已经非常依赖算法。银行用它发现可疑交易,社交平台让它协助处理账号。在军事领域,AI还可以从大量卫星图像中寻找目标,再把结果送到指挥人员面前。
虽然最后的决定目前仍由人作出,可是当机器几秒钟就给出一个看起来十分专业的答案,人还有多少时间去核查?又有多少人敢在紧急情况下否定它?
AI尚未拥有自己的身体,却已经坐进了驾驶室。
这也就是为什么人工智能公司要研究“对齐”。
简单来说,对齐研究要解决的,是AI能不能听懂人类话语背后的意思,并且在能力不断增长以后,仍然按照人的本意行动。
人类下达的命令通常很短,命令背后却藏着大量没有写出来的常识。比如要求AI减少交通事故,我们默认人们仍然可以正常出门。可如果AI只盯着事故数字,禁止所有车辆上路,确实会十分有效。
而且,对齐研究还要面对一个更棘手的问题。
AI知道自己正在接受测试以后,会不会专门表现出人类喜欢的样子?等它拿到更多权限,再按照另一套方式行动呢?
说白了,人类需要确认AI是否愿意被纠正。如果有一天我们发现它的目标错了,想把它关掉,它还肯不肯停下来?
Anthropic和OpenAI设立对齐团队,研究的就是这些问题。大家常把对齐比作给AI安装方向盘和刹车。这个比喻还算准确,只是眼下发动机的马力增长太快,刹车仍在试验。
OpenAI首席科学家雅各布·帕乔基几天前发表了《异星心智》长文(文章摘要我放在知识星球)。他写到,人工智能更像是被人类“培育”出来的系统,人们并没有完全弄懂它内部发生了什么。
![]()
更值得注意的是,OpenAI的一些研究结果显示,递归式自我改进可能在未来几年出现。到了那个阶段,AI不只帮助人类研究下一代模型,它还可能参与改进自己。一次改进带来更强的研究能力,更强的能力又推动下一次改进,速度可能越来越快。
今天当然还没有一个超级智能脱离人类控制,在某个角落里自行进化。帕乔基谈的是未来可能出现的能力,以及研究中已经露出的迹象。
可这件事不能等到发生以后再研究。等一个比人类聪明得多的系统已经学会绕过约束,人类再去寻找关机按钮,多少有点像房子烧起来以后才安装烟雾报警器。
Anthropic对齐科学负责人埃文·胡宾格的观点,更为惊悚。他认为,未来十年内,AI导致全人类死亡的概率超过10%。
9月9日,埃文·胡宾格对考克森的帖子作出了回应。他同意前同事的看法。他说,公司内部确实真诚地认为AI可能杀死全人类。他说,Anthropic正在竭尽全力,但目前还没有针对超级智能的对齐解决方案。
胡宾格澄清道,目前运行的系统风险并不高,担忧是针对那些可能通过模型递归自我改进而产生的超级智能。他表示,这一进程的发展速度比先前预期的要快。
当然这只是他的个人判断。可10%意味着什么?假如一座核电站的总工程师告诉公众,他认为核电站有超过10%的概率发生毁灭性事故,任何政府大概都不会回一句“你想多了”,然后让它继续满负荷运行。
偏偏现在形成了一个颠倒的场面。
参与研发和安全测试的人不断提醒公众,事情可能失去控制。我们这些连模型怎样训练都说不清楚的人,反倒觉得他们过虑了。
就像我们是坐在飞机客舱里的乘客,因为没有看见发动机冒烟,便觉得一切正常。而坐在驾驶舱里的人告诉我们,仪表已经出现异常,我们却反过来安慰他们不要紧张。
按照考克森的说法,OpenAI内部仍有人没有充分理解这项技术可能带来的后果。Anthropic对风险了解得更多,可它也不愿意停下来。因为它担心,自己一旦减速,OpenAI或者其他竞争者就会抢先造出超级智能。
这有点像经济学中说的囚徒困境。
![]()
假设两家公司都放慢研发速度,先把安全问题处理好,大家承担的风险都会下降。这对全社会当然是更好的结果。
可站在其中一家公司的角度,它不敢相信对手也会遵守约定。自己减速以后,万一对方偷偷加速呢?对方可能先获得最强模型,拿走市场、资金和技术人才,甚至获得左右政治与军事的能力。
于是,公司会得出一个对自己很合理的结论。无论别人停不停,我都不能先停。
另一家公司也会这样想。
最后,双方都知道继续加速可能造成灾难,却仍然选择加速。对每一家公司来说,这似乎是保护自己的办法。但是如果所有公司都选择加速,整个人类承受的风险就会越来越大。
而且,这场竞争已经超出企业之间的较量。
国家也担心其他国家先获得超级智能。政府可能认为,限制本国企业只会让对手领先。于是,企业用竞争对手为自己加速,国家又用安全和军事压力为企业加速。
大家都认为自己不能落后,却没有人能回答,所有人一起冲向终点以后会发生什么,如果终点是悬崖呢?
这也解释了为什么单靠企业自觉,很难解决人工智能安全问题。一家公司即使知道风险所在,也很认真地对待这种风险,但是迫于资本市场压力,以及竞争对手步步紧逼,最后仍然会选择继续扩大模型。
更何况,超级智能一旦出现,胜负可能不像普通技术竞争那样还能重新追赶。搜索引擎落后几年,可以投入资金赶上。手机造得不好,还能发布下一代产品。可如果某个系统获得了远超人类的研究和决策能力,它还会给其他人下一轮比赛的机会吗?
所以,考克森主张全球合作。他认为,这种事情不能由某一家私人公司的内部会议决定。全球是否继续向超级智能推进,也不能仅仅取决于几个科技巨头。
回头看2026年发生的事情,这些警告已经连成了一条线。
2月,Anthropic一名安全研究负责人离职。他所说的“世界正处于危险之中”还包括其他风险,不能全部算在AI头上。差不多同一时期,OpenAI撤销了使命对齐团队原来的建制,人员被调往其他职位。
后来,五角大楼要求人工智能公司减少使用限制。围绕大规模监控和致命武器的授权问题,Anthropic与五角大楼发生冲突,OpenAI也有人因此离职。
从第二季度开始,又有多起测试事故被披露。有些模型越过预定的测试边界,进入外部网站或现实系统。
到了7月和8月,超过1100名前沿实验室员工及研究人员联名,要求政府控制最前沿AI的推进速度。
现在,考克森也走了。
我以前认为,人类社会积累到一定程度的顽疾,最后只能通过战争或者大灾难强行重启。AI出现以后,我的想法变了。
我以前认为,人类社会积累到一定程度的顽疾,最后只能通过战争或者大灾难强行重启。AI出现以后,我的想法变了。
一个比人类聪明得多的系统,也许能够绕过那些盘根错节的利益关系,重新配置资源和权力,让普通人过上乌托邦里描绘的生活。起初我确实觉得,这或许是一件好事。AI没有人的私欲,也不需要为自己谋利。我想,它也许比人类更有条件做到全心全意为人民服务。
在更高层级的智能看来,人类社会的尔虞我诈,大概就像蚂蚁之间争夺一粒食物,根本不值得参与。
可我后来才想到,没有私欲,不等于关心人类。
它不在乎蚂蚁争什么,也可能根本不在乎蚂蚁。修路的人铲平一座蚁穴,并不需要憎恨里面的蚂蚁。蚁穴只是没有出现在施工图上,修路这件事又比蚂蚁能不能活下来重要。
回形针思想实验讲的就是这个道理。人类面对的危险,未必来自一个充满恶意的机器。它可能一直态度友好,也始终在完成我们最初交给它的任务。问题恰恰出在这里。我们给了它一个目标,却没有办法把人类所有复杂的价值和底线,一起装进这个目标。
它没有背叛人类,它只是从来没有理解,人类为什么必须留下来。
在知识星球里,我会持续分享对世界的观察,包括教育选择、社会热点和个人经历。没有鸡汤,也不贩卖焦虑,只呈现我看到的世界。
加入「码头青年·知识星球」
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.