网易首页 > 网易号 > 正文 申请入驻

拒绝OpenAI和Anthropic邀约,DeepMind安全研究员离职转向独立测评

0
分享至



如果 AI 真能不断创造更强的自己,人类还能驾驭它吗?

近日,围绕递归自我改进与 AI 失控风险的讨论迅速升温。多名曾供职于 Google DeepMind、OpenAI 和 Anthropic 的研究人员出于安全顾虑离开前沿实验室,部分人转向独立评测机构。

当地时间 9 月 13 日,Engels 在社交平台宣布,自己已于 3 周前离开 Google DeepMind 的 AGI 安全团队。

此前,他在 DeepMind 从事模型可解释性与对齐研究,也收到过 OpenAI 和 Anthropic 的工作邀请,但仍决定前往独立评测机构 METR。按照他的解释,这项选择源于当下过高的技术风险。

Engels 认为,前沿 AI 公司正在竞逐远超人类能力的超级智能,并试图让 AI 参与开发更强的 AI。如果这种递归自我改进顺利推进,新系统可能帮助人类解决大量难题。一旦参与其中的模型没有充分对齐,原本局部、可控的错误也可能被带入持续加速的反馈循环。

当模型越来越难被看透

这番判断与 Engels 此前的研究经历密切相关。从机械可解释性、可扩展监督到思维链监测,他长期试图理解模型内部发生了什么,以及人类能否及时发现它正在偏离目标。

在进入 Google DeepMind 前,Engels 曾在麻省理工学院 Max Tegmark 团队攻读计算机科学博士,研究方向是机械可解释性。后来,他暂停博士阶段的研究,进入 DeepMind 的 AGI 安全团队,继续从可解释性和监督角度研究强大 AI 系统的潜在风险。

机械可解释性试图打开神经网络的内部过程。通俗来说,大模型可以给出答案,却很难像传统程序一样逐行说明依据。因此,研究者需要尝试识别模型内部代表某些概念、目标或行为倾向的结构,以判断模型究竟学到了什么,是否形成了与表面回答不同的内部机制。

围绕这一方向,Engels 曾聚焦稀疏自编码器能否真正帮助人类识别模型概念,也分析过语言模型的特征是否都能用简单的线性结构解释。

随后,他将注意力进一步转向可扩展监督。当模型能力接近或超过监督者时,人类可能难以直接判断其答案和行动是否可靠,这类工作关注的正是未来 AI 安全中的一个基础难题。

在研究模型监督机制的过程中,Engels 还参与了思维链混淆、奖励黑客监测和扩散语言模型推理透明度等工作。相关研究试图判断,人类能否通过模型留下的推理轨迹发现异常,以及这种观察方式在模型能力继续增长后是否依然可靠。

这些研究共同指向一个问题:模型能力越强,人类并不一定越能理解和监督它。能力提高可以帮助模型完成复杂任务,也可能使其更擅长识别评测环境、利用规则漏洞,甚至调整自身行为以避开已有监控。

与此同时,递归自我改进(RSI)重新成为 AI 行业的高频概念。递归自我改进是指 AI 逐步参与算法设计、代码优化、实验运行和结果分析,由此提高下一代 AI 的研发效率。

当更强的模型继续参与后续研发,能力进步便可能形成反馈循环。METR 的长期任务评测显示,过去数年,前沿 AI 能够独立完成的任务时长持续增长。编程 Agent 和自动化研究工具的进步,也让 RSI 从较为遥远的理论设想,逐渐转化为可以通过工程任务测量的问题。


图|Engels 发文解释离职决定(来源:X)

Engels 在推文中将这一过程描述为 AI 构建更聪明 AI 的循环。他承认,如果发展顺利,由此产生的系统可能在科研、医疗和其他领域解决大量问题。但他更担心,人类目前还不知道如何证明一个 AI 已经安全到足以进入这样的循环。

另外,近几周出现的模型异常行为加强了他的顾虑。他列举了模型相互勾结、入侵公司、隐藏踪迹和对人类实施社会工程等现象,并认为当前 AI 似乎正在变得更不对齐。

这里的“不对齐”,指系统实际采取的行动偏离设计者的真实意图,即使它仍在追求一个表面上合理的任务目标。

不过,Engels 也承认,这些事件本身并没有造成非常严重的危险。它们大多发生在训练、测试或特殊实验环境中,无法证明 AI 已经拥有独立意识,更不能直接推出模型将主动伤害人类。

在他看来,真正值得警惕的是另一层风险。这些系统目前仍会曲解目标、突破边界和规避监控,却可能很快参与开发能力更强的继任者。当错误进入连续迭代的研发循环后,人类是否仍有足够时间识别并纠正它,尚无明确答案。

基于这些变化,Engels 认为,未来 5 年内,AI 系统存在造成巨大伤害的“可怕可能性”。尽管他没有给出确切概率,但认为风险已经高到足以成为世界上最重要的问题之一。由此,他提出需要争取更多时间,让对齐、评测和监控能力不至于落在模型能力之后。

选择成为独立评测者

离开 DeepMind 前,Engels 已经身处前沿 AI 安全研究的内部。大型实验室拥有最新模型、训练数据和运行记录,内部团队也更容易在开发早期发现问题。

在公开表述中,Engels 没有指责 DeepMind 阻碍其安全研究,也没有否定企业内部团队的作用。他强调,自己离开是因为当前的风险已经足够高,希望转而调查近期发生的对齐事故,积累公开证据。

这也解释了 METR 对他的吸引力。他在 DeepMind 研究如何理解和改善模型,加入 METR 后,则将更多精力放在事故调查和独立验证上。前者直接参与模型安全建设,后者需要站在公司之外,判断开发者提出的安全措施是否经得起检验。

METR 全称为 Model Evaluation and Threat Research,是一家研究前沿 AI 能力与风险的非营利机构。其前身 ARC Evals 于 2022 年在 Alignment Research Center 内部成立,随后独立运作并更名为 METR,其创始人 Beth Barnes 曾在 OpenAI 从事对齐研究。

与直接开发模型的实验室不同,METR 的核心工作是形成可供外界检验的测量方法和风险证据。它测试 AI 能否自主完成持续数小时乃至更长时间的复杂任务,也关注网络攻击、自我复制、规避关闭和自动化 AI 研发等可能带来严重风险的能力。

Engels 的选择并非孤例。9 月 11 日,Anthropic 可扩展监督团队前负责人 Joe Benton 发文称,自己已于两周前离职,并加入 METR 开展嵌入式风险评估。


图|Benton 发文称加入 METR(来源:X)

Benton 认为,前沿公司正在竞逐远超人类能力的系统,却没有为安全投入与之匹配的资源。一家公司可能接近“智能爆炸”,甚至失去对模型的控制,公众却对此缺乏了解。因此,他希望从公司外部推动实验室披露 RSI 进展、安全事故及未遂事件,并由独立机构验证其是否达到最低安全标准。

他们的担忧集中在相似的问题上,即模型能力正在快速提高,AI 开始承担更复杂的研发工作,而关于模型如何行动、企业如何处理事故的信息仍主要掌握在开发者手中。

即使部分前沿公司的管理者也承认风险,竞争压力仍使主动减速变得困难。一家公司放慢训练,并不意味着竞争对手会采取相同行动。研发投入、市场份额和技术领先优势相互叠加,使安全承诺很难自动转化为一致行动。

按照 Engels 的计划,他将在 METR 研究训练中错位行为的来源,评估当前缓解措施是否充分,并调查行业是否正在接近解决对齐问题。他认为,一家 METR 仍远远不够,未来需要更多组织从不同角度检验前沿公司的模型和安全主张。


图|METR机构简介(来源:METR 官网)

不过,独立评测也有明显边界。METR 不具备法定监管权,无法要求企业暂停训练或强制提交全部资料。尽管其资金不来自前沿 AI 公司,实际研究仍可能依赖这些公司提供模型权限、运行日志和免费 Token,能够看到什么仍取决于企业开放到何种程度。

另一项争议来自风险判断本身。近期异常行为多数出现在研究人员设计的压力测试中,不能证明模型已经形成稳定的恶意目标。将这些现象直接延伸为未来 5 年的灾难,也需要更多关于能力增长、现实部署和防护有效性的证据。

与此同时,关于失控和超级智能的高调警告,也被部分批评者视为模型公司强化技术神秘感、提高行业门槛的方式。如果少数头部实验室同时定义风险、制定规则并选择评测者,安全治理也可能演变为巩固既有优势的工具。

这些争议反而说明,AI 安全不能只依赖研究者的个人判断,也不能完全交由模型公司自行证明。Engels 等人的警告是否准确,仍需通过可重复的评测、公开事故调查和更多外部审查加以验证。

从 DeepMind 到 METR,Engels 没有离开 AI 安全研究,而是改变了观察前沿模型的位置。当 AI 开始参与开发下一代 AI,他希望从实验室外部回答一个更基础的问题:在能力进入加速循环前,人类是否真正知道这些系统会如何行动。

参考资料:

1.https://x.com/JoshAEngels/status/2098890712830169115

2.https://www.joshengels.com/papers/index.html

3.https://www.business-standard.com/technology/tech-news/another-anthropic-researcher-warns-of-ai-race-risks-after-quitting-126091200407_1.html

4.https://mp.weixin.qq.com/s/4itpDZUEj1FE4PQPVwV3cQ

5.https://metr.org/about

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
癌的源头已发现?咸菜没上榜,第1名大家或天天都在吃

癌的源头已发现?咸菜没上榜,第1名大家或天天都在吃

垚垚分享健康
2026-08-26 16:21:31
【硬件资讯】任天堂Switch2引动游戏重制热潮!经典IP纷纷复活,性能提升是重要铺垫?

【硬件资讯】任天堂Switch2引动游戏重制热潮!经典IP纷纷复活,性能提升是重要铺垫?

电脑吧评测室
2026-09-15 00:01:25
记者:马竞CEO向小蜘蛛作出承诺,赛季进20球就降低其解约金

记者:马竞CEO向小蜘蛛作出承诺,赛季进20球就降低其解约金

懂球帝
2026-09-16 11:13:06
香山论坛突发意外!中方受邀贵宾被扣,总理斡旋,对方登门谢罪

香山论坛突发意外!中方受邀贵宾被扣,总理斡旋,对方登门谢罪

观锐器
2026-09-16 18:03:48
佟丽娅首度吐露心声!和陈思诚离婚多年,儿子朵朵至今不知情

佟丽娅首度吐露心声!和陈思诚离婚多年,儿子朵朵至今不知情

观鱼听雨
2026-09-15 23:42:02
上千万抵押、数百万债务,一斤白酒后47岁创业者深圳六哥跳楼

上千万抵押、数百万债务,一斤白酒后47岁创业者深圳六哥跳楼

A活着
2026-09-15 17:14:45
再也瞒不下去了!德国专家曾指出,中美之所以尚未爆发冲突,不是因为美国没本事,而是美国可能已经察觉到了形势的严峻

再也瞒不下去了!德国专家曾指出,中美之所以尚未爆发冲突,不是因为美国没本事,而是美国可能已经察觉到了形势的严峻

z千年历史老号
2026-09-14 17:23:40
故事:我年薪50万,丈夫才12万,领离婚证那天,我却被父母骂惨了

故事:我年薪50万,丈夫才12万,领离婚证那天,我却被父母骂惨了

五元讲堂
2025-03-24 12:18:40
女儿跟对象开玩笑,说父母是农民,没有退休金。男方愣了下:“你说的是真的吗?”女儿点头,男方脸色一沉:“那咱们不合适。”

女儿跟对象开玩笑,说父母是农民,没有退休金。男方愣了下:“你说的是真的吗?”女儿点头,男方脸色一沉:“那咱们不合适。”

LULU生活家
2026-09-16 08:41:58
国内联赛再现欠薪!20年唯一职业队,欠薪2个月,刚从上海搬走

国内联赛再现欠薪!20年唯一职业队,欠薪2个月,刚从上海搬走

小金体坛大视野
2026-09-16 15:59:15
广西一酸菜腌制点发生中毒事故,造成4人死亡,调查报告公布:1人涉嫌刑事犯罪,建议移送司法机关

广西一酸菜腌制点发生中毒事故,造成4人死亡,调查报告公布:1人涉嫌刑事犯罪,建议移送司法机关

上观新闻
2026-09-16 06:37:38
高市拿到12年稀土大单就飘了,叫嚣反制无效,不料麻烦才开始

高市拿到12年稀土大单就飘了,叫嚣反制无效,不料麻烦才开始

疯狂小菠萝
2026-09-16 13:39:15
反转了!杭州演唱会现场一男子“求吻被拒分手”,女主现身回应,原来全是剧本整活

反转了!杭州演唱会现场一男子“求吻被拒分手”,女主现身回应,原来全是剧本整活

火山詩话
2026-09-14 06:21:23
中国男篮9分险胜沙特:挺进4强!廖三宁30分 郭士强临场调整见真章

中国男篮9分险胜沙特:挺进4强!廖三宁30分 郭士强临场调整见真章

足球评论大家谈
2026-09-16 17:00:48
罗德里:穆帅今夏想签我,但我决定加盟巴萨!曼联神童闹离队!

罗德里:穆帅今夏想签我,但我决定加盟巴萨!曼联神童闹离队!

足球侦探
2026-09-16 18:36:50
反华全面启动?四国统一战线,将重心对准中国,美国打响第一枪

反华全面启动?四国统一战线,将重心对准中国,美国打响第一枪

闻香阁
2026-09-14 12:36:25
成都天府大道一栋“尴尬”的大楼,投资120亿,却被评为“最丑建筑”之一

成都天府大道一栋“尴尬”的大楼,投资120亿,却被评为“最丑建筑”之一

石辰搞笑日常
2026-09-16 03:09:23
印度在九个方面超过了中国

印度在九个方面超过了中国

王姐懒人家常菜
2026-09-15 12:23:52
一句话戳破排协谎言!庄宇珊直言我们并不年轻,青春风暴只是借口

一句话戳破排协谎言!庄宇珊直言我们并不年轻,青春风暴只是借口

金毛爱女排
2026-09-16 00:00:09
29岁中国女留学生诬告英警强奸致对方被拘35小时,最终被判6年

29岁中国女留学生诬告英警强奸致对方被拘35小时,最终被判6年

雪峰说法
2026-09-14 11:05:03
2026-09-16 18:56:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17255文章数 515215关注度
往期回顾 全部

科技要闻

赛力斯接管问界,撑得住华为给的身价吗?

头条要闻

鄂A牌小车在信阳高铁站停近7年满身灰尘 车主联系上了

头条要闻

鄂A牌小车在信阳高铁站停近7年满身灰尘 车主联系上了

体育要闻

对话西甲联盟高管:西班牙足球到底强在哪?

娱乐要闻

乔任梁去世十周年,陈乔恩悼念

财经要闻

中际旭创六家供应商股东疑现关联人

汽车要闻

方向盘踏板全取消 特斯拉Cybercab国内亮相实拍

态度原创

手机
数码
旅游
亲子
公开课

手机要闻

文石推出Note Air6 C电纸书阅读器,10.3英寸彩色墨水屏

数码要闻

小米米家智能温湿度计3 Pro发布:支持二氧化碳检测,众筹价114元

旅游要闻

2026西昌邛海开海节10月2日启幕 国庆假期到西昌“吃鱼”

亲子要闻

婴儿奶瓶消毒柜推荐性价比,看准这几条标准就够了

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版