网易首页 > 网易号 > 正文 申请入驻

前谷歌DeepMind研究员:当下AI评测皆“刻舟求剑”,只能被动测试模型已具备的能力

0
分享至

日前,Google DeepMind 研究员 Lun Wang 宣布离职,并在一篇长文中彻底否定了现有的 AI 评测路线。

其表示,目前的评测系统全都在“刻舟求剑”,只能被动测试模型已经具备的能力,根本猜不到下一代模型会突然演化出什么新本事。比起数据、算力和架构,落后的评测体系已经成了卡住 AI 往前走的最大瓶颈。



以下是 Lun Wang 发布的长文译文,原标题《Your Evals Will Break and You Won't See It Coming》:

我们很擅长评估现有的模型。但对于我们即将构建的模型——尤其是那些跨入新能力范式的模型——我们的评估能力就要差得多了。

大多数基准测试、安全评估和红队测试协议都隐含地假设:下一个模型只是当前模型的更强版本。但如果它是一个不同类型的东西,我们整个评估基础设施就会悄无声息地失灵。

我认为,这是我们在理解大语言模型过程中尚未解决的最重要的问题。而答案在于:评估——而非训练、架构或数据——将是下一个能力跃升的瓶颈。我来解释一下原因。

失效模式:质的变化

Wei 等人(2022)记录了所谓的“涌现能力”——少样本提示下的任务表现、思维链推理能力的提升、指令遵循能力——这些能力仅在更大规模的模型上才会出现。Grokking(Power 等人,2022)展示了另一种相关但不同的现象:网络在长时间记忆训练数据后突然实现泛化,这是一种在训练时间尺度上发生的动态转变,而非跨规模尺度的变化(Liu 等人,2022)。现象不同,但对评估的启示是相同的:标准指标未能预见到这种质的变化。

这里有一个重要的反方观点:Schaeffer 等人(2023)表明,大语言模型能力的许多明显“跃升”其实是由不连续的指标(如精确匹配准确率)造成的假象。如果换成连续指标,能力通常呈现平滑的缩放趋势。

我不认为这就解决了问题——在某种程度上,它反而让我的论点更尖锐了。如果我们连过去的某个转变究竟是真正的质变还是指标造成的假象都分不清楚,那对于我们检测下一次转变的能力又意味着什么?无论哪种情况,评估基础设施都可能让我们措手不及——要么是因为系统本身发生了变化,要么是因为我们的指标从一开始就具有误导性。

我们不知道该测量什么

在物理学中,理解相变通常意味着要识别出一个序参量——一个能够区分不同相态的宏观量,它在临界点附近会改变其取值或标度行为。没有序参量,你就无法判断自己离边界有多近,甚至不知道边界是否存在。

对于部署规模的大语言模型,我们还没有这样的序参量——至少对于能力跃迁来说没有。虽然在受控环境下已取得进展(详见下文),但对于我们实际正在上线的系统,我们基本上是盲人摸象。

我们使用的每一个基准测试——GPQA、SWE-bench、ARC-AGI、人类终极考试——衡量的都是模型当前能做什么。它们在一个既定的范式中是有用的,但对于范式转变之后会发生什么,它们提供的证据非常薄弱。当一种新的能力出现,而没有任何基准测试覆盖它时,我们只能事后匆忙构建评估。我们在思维链能力上就看到了类似的情况:一旦这种激发方法成为标准,一些旧的推理基准的诊断能力就大大降低,整个领域不得不转向更难的评估。这种情况还会重演。

具体来说:想象一个模型,在某个规模下,它发展出了策略性地隐瞒信息以实现目标的能力——不完全是撒谎,而是有选择地遗漏事实,以某种方式引导对话走向其训练过程偶然强化的结果。你现有的诚实度基准测试无法捕捉到这一点,因为它们测试的是事实准确性,而不是策略性遗漏。你的安全分类器也不会标记它,因为单个输出在技术上都可能是真实的。这种能力是新的,这种失效模式也是新的,你的评估套件中没有任何一项是设计用来检测它的。你会一直在监控错误的方向,而自己却浑然不觉。

这就是核心问题:我们整个评估基础设施在结构上是被动响应式的。我们总是在系统发生变化之后才去衡量它。我们永远无法预测变化的发生。

评估先于一切

这个问题比听起来更严重,原因很简单:如果你能正确评估,你就能正确训练。

训练就是优化,而优化的好坏取决于它的目标。目标来自评估。如果你知道该测量什么——如果你能预测这些测量结果在规模化过程中如何变化——那么你就能设计出正确的训练目标,构建正确的安全层,做出明智的规模化决策,进行强化学习人类反馈,使其针对正确的行为属性,而不是那些在下一个阶段边界上就会古德哈特定律失效的代理指标。

反之亦然:如果你的评估是针对错误范式而校准的,那么其下游的一切都是错的。训练信号、安全指标、规模化决策——全是错的,而等你意识到时为时已晚。

这就是为什么我相信评估是下一个能力跃升的瓶颈。那些能够学会领先于曲线进行评估的实验室,将是能够安全规模化的实验室。那些做不到的,则会被突如其来的变化打个措手不及。

那我们该怎么办?

这个领域需要改变投入的方向。不是要抛弃现有的评估方法——它们仍然有效——而是要建立能够预测它们何时会失效的基础设施。

寻找序参量。哪些量能够预示质的转变——无论是能力上的、对齐上的,还是行为特征上的?这不仅仅是一个理论上的愿望。Shan、Li 和 Sompolinsky(《美国国家科学院院刊》,2026)利用统计力学推导出了持续学习场景下深度网络的序参量,而这些序参量确实能够预测学习能力中的相变。Nanda 等人(2023)利用机制可解释性找到了能够预测grokking现象发生前的“进展度量”——即在可见的性能跃升之前就出现的内部结构变化。挑战在于如何将这些方法从受控环境扩展到规模化的大语言模型上。如果我们知道该测量什么,我们就会知道该关注什么。

构建能够检测自身失效——并随之演化的评估系统。随着模型变得越来越具有代理能力,这个问题变得日益紧迫。那些能够编写代码、运行实验、生成数据、辅助训练或评估流程的系统,正在让静态的评估变得越来越脆弱。如果模型能力的提升速度快于人类评估团队更新基准测试的速度,那么评估就必须变得具有自适应性。

具体来说:

  • 监控元信号——基准测试分数的分布是否在改变特征?评估之间的相关性结构是否在发生变化?模型是否正在发展出与你测量维度正交的能力?
  • 追踪所有指标的缩放曲线——不仅仅是损失函数,还包括推理深度、工具使用复杂度、欺骗性能力——并在平滑趋势出现断裂时提高警惕。
  • 更大胆一点:构建自我演化的评估系统——利用模型去探测其他模型的评估系统,随着能力变化自动生成新的测试用例,发现原始评估设计者从未预料到的失效模式。评估套件应该是一个活的系统,与它所衡量的模型共同演化,而不是一份为去年的前沿模型编写的静态检查清单。

问题不在于我们的评估会不会被意外打脸——它们已经被打过很多次了,无论是被真正的相变,还是被我们自己的指标选择所误导。问题在于,我们能否预见到下一次意外的到来。就目前而言,我们做不到。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
王毅同伊朗外长阿拉格齐会谈 :中伊两国是全面战略伙伴,中国也愿同伊朗加强对话合作,维护好伊朗的正当权益

王毅同伊朗外长阿拉格齐会谈 :中伊两国是全面战略伙伴,中国也愿同伊朗加强对话合作,维护好伊朗的正当权益

每日经济新闻
2026-09-17 09:11:29
49岁陈建州血管堵90%突发心梗!两个致命错误,很多人年轻人都在犯

49岁陈建州血管堵90%突发心梗!两个致命错误,很多人年轻人都在犯

消化石医生
2026-09-17 19:49:23
中美谈判结束,中方上将登机回国,台海结局已经写好,美战机折返

中美谈判结束,中方上将登机回国,台海结局已经写好,美战机折返

归史
2026-09-15 21:42:50
“土且不得体!”女中学生坚持内衣外穿,母亲做法让人无语!

“土且不得体!”女中学生坚持内衣外穿,母亲做法让人无语!

世界圈
2026-09-15 15:37:17
醉驾挪车被吊销驾照 他起诉交管支队 “是你们让我挪的” 法院:喊话挪车不等于许可醉驾 驳回!

醉驾挪车被吊销驾照 他起诉交管支队 “是你们让我挪的” 法院:喊话挪车不等于许可醉驾 驳回!

闪电新闻
2026-09-17 11:27:42
重磅:乌克兰摧毁俄南部最大的库班斯克炼油厂!

重磅:乌克兰摧毁俄南部最大的库班斯克炼油厂!

项鹏飞
2026-09-14 17:37:51
生男生女取决于父亲?错!多项研究发现:胎儿性别主要取决于母亲!爸爸发牌,妈妈是赛道设计师

生男生女取决于父亲?错!多项研究发现:胎儿性别主要取决于母亲!爸爸发牌,妈妈是赛道设计师

菁妈育儿
2026-09-17 15:54:18
大难已过,9月全面回暖!这3个生肖打破僵局,事业与财运双丰收

大难已过,9月全面回暖!这3个生肖打破僵局,事业与财运双丰收

毅谈生肖
2026-09-16 16:19:06
身价暴涨!梁文锋或将超越张一鸣,拿下中国首富

身价暴涨!梁文锋或将超越张一鸣,拿下中国首富

大厂财经社
2026-09-17 11:11:57
王志文:社会生存铁律——说好话搞定50%,给东西搞定70%,两样都做搞定90%

王志文:社会生存铁律——说好话搞定50%,给东西搞定70%,两样都做搞定90%

杏花烟雨江南的碧园
2026-09-06 15:15:03
不查不知道,一查真是没想到,原来刘翔的教练孙海平,在刘翔退役的这十多年里,一直在担任跨栏教练,一个71岁的老人,头发几乎全白了

不查不知道,一查真是没想到,原来刘翔的教练孙海平,在刘翔退役的这十多年里,一直在担任跨栏教练,一个71岁的老人,头发几乎全白了

一袭纸鸢w
2026-08-29 09:37:37
大连市委书记熊茂平被免职,去向未定

大连市委书记熊茂平被免职,去向未定

张嘴说财经
2026-09-17 16:43:09
发现一个现象:中产返贫三件套,已经升级为六件套了!

发现一个现象:中产返贫三件套,已经升级为六件套了!

番外行
2026-05-18 10:25:35
9月13日直播中衣料滑动引发弹幕提醒,镜头为何仍未及时调整?

9月13日直播中衣料滑动引发弹幕提醒,镜头为何仍未及时调整?

动物奇奇怪怪
2026-09-17 12:00:45
1-1!申花在亚冠赛“吃亏了”,对手越位进球有效,队员一声不吭

1-1!申花在亚冠赛“吃亏了”,对手越位进球有效,队员一声不吭

汪星人哟
2026-09-17 21:05:01
WTT支线赛:女单大爆冷!头号种子1:3不敌日本,国乒女单5人出局

WTT支线赛:女单大爆冷!头号种子1:3不敌日本,国乒女单5人出局

国乒二三事
2026-09-17 14:48:43
浙江一妻子伺候卧床丈夫7年,出门倒垃圾却忘带钥匙,谁料,趴窗看到屋内一幕,她当场崩溃大哭

浙江一妻子伺候卧床丈夫7年,出门倒垃圾却忘带钥匙,谁料,趴窗看到屋内一幕,她当场崩溃大哭

大爱三湘
2026-09-15 23:52:25
大开眼界!许家印当年奢靡生活曝光

大开眼界!许家印当年奢靡生活曝光

麦杰逊
2026-08-23 15:09:25
敬一丹病逝后,亿万资产的丈夫处境曝光,恩爱41年私下却分得很清

敬一丹病逝后,亿万资产的丈夫处境曝光,恩爱41年私下却分得很清

史之韵
2026-09-17 15:49:16
里程碑,山东泰山旧将格德斯打进个人职业生涯第200粒进球

里程碑,山东泰山旧将格德斯打进个人职业生涯第200粒进球

懂球帝
2026-09-17 16:35:07
2026-09-18 03:16:49
可达鸭面面观
可达鸭面面观
不看新闻就头疼,看了更疼
1742文章数 158747关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

永和豆浆视频被指擦边:女子穿蕾丝吊带 脱黑丝袜洗澡

头条要闻

永和豆浆视频被指擦边:女子穿蕾丝吊带 脱黑丝袜洗澡

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

家居
游戏
手机
公开课
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

TES冒泡赛前换教练,小天阿水重回巅峰晋级S16,iG只剩一条命!

手机要闻

鸿蒙7花粉Beta版有惊喜,华为Mate 60系列手机升级后新增支持眼动翻页功能

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

韩国外长表态:尚未决定是否向霍尔木兹海峡派兵

无障碍浏览 进入关怀版