“那些认真开发人工智能的人,真心相信它可能会在十年内杀死我们所有人。”今天,Anthropic 预训练研究员 Jacob Coxon 在 X 上发表的离职感言上如是发出警示。
他强调称,“这不是营销噱头”。
他说,过去三年里,他先后在 OpenAI 和 Anthropic 从事预训练研究,但如今认为,“两家公司都没有负责任地行事”,正在“直奔自我改进的超级智能”,并“拿我们的生命赌博”。
![]()
Coxon 针对的并不是现有 AI 模型,而是下一阶段的新版本。
“不要低估这项技术的力量。”他说,未来的系统将很快成为“超人类系统”,能够入侵几乎任何系统,在一夜之间改变整个领域,并获得现实世界中的权力和资源。
他认为,过去几年人们已经亲眼看到这些能力在不断进步,而且“进步并未放缓”。
他同时指出, OpenAI 与 Anthropic 对这种风险的态度并不完全相同。
在Coxon的描述中,OpenAI 内部有些人还没有充分意识到风险的“文明尺度”;而 Anthropic “充分理解风险”,但也已经陷入“抢先到达”的竞争。
Coxon 因此把当前的 AI 竞赛称为一场“傲慢的赌博”。
在他看来,让一家私人公司决定是否进入 AI 的“终局”,并不是一个合理的过程;而所谓加速对齐研究,也应该建立在“确信不存在更好路径”的非凡信心之上。
但他并没有主张简单放弃 AI。恰恰相反,他说自己对协调仍然“持乐观态度”。
他认为,近期一些 AI 安全事件——包括他所说的 Hugging Face 事件——可能成为推动美国 AI 实验室之间达成“节奏协议”的警示信号。
但他担心的是,目前全球 AI 竞争并没有朝着被阻止的方向发展,甚至可能需要采取“暂时禁止提升模型能力”这样的代价高昂措施。
“你想在没有对其思维有严格理解的情况下,启动一次超级智能强化学习运行吗?”Coxon 如是反问AI 实验室里的研究员同行,“你应该因为‘反正它都会发生’而埋头苦干——还是抓住这一刻,呼吁不同的条件?”
这一贴文随后引发了大量关注和讨论。
比如,Anthropic 对齐研究负责人 Evan Hubinger 转评称,“Jacob 是正确的——我们确实真诚地相信 AI 可能会杀死所有人类!我个人认为在未来十年内发生的可能性>10%。”
他还说,Anthropic 正在尽最大努力,但即使如此,“还没有解决超级智能对齐问题的计划,也没有明确在正确的轨道上”。
![]()
Evan Hubinger 长期研究“欺骗性对齐”(deceptive alignment)等问题,是这个领域的权威。
正如 Anthropic 在最新的《风险报告》中所说,他认为“当前模型的风险很低”,真正值得担心的是“超级智能通过递归自我改进而出现”,而且“这种情况的发展速度比我们预期的更快”。
![]()
前几天,OpenAI 首席科学家 Pachocki发文警示称,如果AI继续沿着目前的道路发展,未来几年出现的系统很可能还会经历幅度相当甚至更大的能力跃迁,而且它们将越来越多地推动自身的发展,“这是一个需要极度谨慎的时刻”。
“我担心,没有人真正准备好应对机器智能持续快速提升所带来的后果。”他说,目前没有任何AI实验室已经把对齐和监控做到足以支撑长期高速扩展的程度。
看来,整个行业对此已经基本形成共识,但具体怎么行动,除了暂停前沿模型研究外,一方面还没有可能有效的途径,也远未有共识。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.