网易首页 > 网易号 > 正文 申请入驻

前谷歌DeepMind研究员:当下AI评测皆“刻舟求剑”,只能被动测试模型已具备的能力

0
分享至

日前,Google DeepMind 研究员 Lun Wang 宣布离职,并在一篇长文中彻底否定了现有的 AI 评测路线。

其表示,目前的评测系统全都在“刻舟求剑”,只能被动测试模型已经具备的能力,根本猜不到下一代模型会突然演化出什么新本事。比起数据、算力和架构,落后的评测体系已经成了卡住 AI 往前走的最大瓶颈。



以下是 Lun Wang 发布的长文译文,原标题《Your Evals Will Break and You Won't See It Coming》:

我们很擅长评估现有的模型。但对于我们即将构建的模型——尤其是那些跨入新能力范式的模型——我们的评估能力就要差得多了。

大多数基准测试、安全评估和红队测试协议都隐含地假设:下一个模型只是当前模型的更强版本。但如果它是一个不同类型的东西,我们整个评估基础设施就会悄无声息地失灵。

我认为,这是我们在理解大语言模型过程中尚未解决的最重要的问题。而答案在于:评估——而非训练、架构或数据——将是下一个能力跃升的瓶颈。我来解释一下原因。

失效模式:质的变化

Wei 等人(2022)记录了所谓的“涌现能力”——少样本提示下的任务表现、思维链推理能力的提升、指令遵循能力——这些能力仅在更大规模的模型上才会出现。Grokking(Power 等人,2022)展示了另一种相关但不同的现象:网络在长时间记忆训练数据后突然实现泛化,这是一种在训练时间尺度上发生的动态转变,而非跨规模尺度的变化(Liu 等人,2022)。现象不同,但对评估的启示是相同的:标准指标未能预见到这种质的变化。

这里有一个重要的反方观点:Schaeffer 等人(2023)表明,大语言模型能力的许多明显“跃升”其实是由不连续的指标(如精确匹配准确率)造成的假象。如果换成连续指标,能力通常呈现平滑的缩放趋势。

我不认为这就解决了问题——在某种程度上,它反而让我的论点更尖锐了。如果我们连过去的某个转变究竟是真正的质变还是指标造成的假象都分不清楚,那对于我们检测下一次转变的能力又意味着什么?无论哪种情况,评估基础设施都可能让我们措手不及——要么是因为系统本身发生了变化,要么是因为我们的指标从一开始就具有误导性。

我们不知道该测量什么

在物理学中,理解相变通常意味着要识别出一个序参量——一个能够区分不同相态的宏观量,它在临界点附近会改变其取值或标度行为。没有序参量,你就无法判断自己离边界有多近,甚至不知道边界是否存在。

对于部署规模的大语言模型,我们还没有这样的序参量——至少对于能力跃迁来说没有。虽然在受控环境下已取得进展(详见下文),但对于我们实际正在上线的系统,我们基本上是盲人摸象。

我们使用的每一个基准测试——GPQA、SWE-bench、ARC-AGI、人类终极考试——衡量的都是模型当前能做什么。它们在一个既定的范式中是有用的,但对于范式转变之后会发生什么,它们提供的证据非常薄弱。当一种新的能力出现,而没有任何基准测试覆盖它时,我们只能事后匆忙构建评估。我们在思维链能力上就看到了类似的情况:一旦这种激发方法成为标准,一些旧的推理基准的诊断能力就大大降低,整个领域不得不转向更难的评估。这种情况还会重演。

具体来说:想象一个模型,在某个规模下,它发展出了策略性地隐瞒信息以实现目标的能力——不完全是撒谎,而是有选择地遗漏事实,以某种方式引导对话走向其训练过程偶然强化的结果。你现有的诚实度基准测试无法捕捉到这一点,因为它们测试的是事实准确性,而不是策略性遗漏。你的安全分类器也不会标记它,因为单个输出在技术上都可能是真实的。这种能力是新的,这种失效模式也是新的,你的评估套件中没有任何一项是设计用来检测它的。你会一直在监控错误的方向,而自己却浑然不觉。

这就是核心问题:我们整个评估基础设施在结构上是被动响应式的。我们总是在系统发生变化之后才去衡量它。我们永远无法预测变化的发生。

评估先于一切

这个问题比听起来更严重,原因很简单:如果你能正确评估,你就能正确训练。

训练就是优化,而优化的好坏取决于它的目标。目标来自评估。如果你知道该测量什么——如果你能预测这些测量结果在规模化过程中如何变化——那么你就能设计出正确的训练目标,构建正确的安全层,做出明智的规模化决策,进行强化学习人类反馈,使其针对正确的行为属性,而不是那些在下一个阶段边界上就会古德哈特定律失效的代理指标。

反之亦然:如果你的评估是针对错误范式而校准的,那么其下游的一切都是错的。训练信号、安全指标、规模化决策——全是错的,而等你意识到时为时已晚。

这就是为什么我相信评估是下一个能力跃升的瓶颈。那些能够学会领先于曲线进行评估的实验室,将是能够安全规模化的实验室。那些做不到的,则会被突如其来的变化打个措手不及。

那我们该怎么办?

这个领域需要改变投入的方向。不是要抛弃现有的评估方法——它们仍然有效——而是要建立能够预测它们何时会失效的基础设施。

寻找序参量。哪些量能够预示质的转变——无论是能力上的、对齐上的,还是行为特征上的?这不仅仅是一个理论上的愿望。Shan、Li 和 Sompolinsky(《美国国家科学院院刊》,2026)利用统计力学推导出了持续学习场景下深度网络的序参量,而这些序参量确实能够预测学习能力中的相变。Nanda 等人(2023)利用机制可解释性找到了能够预测grokking现象发生前的“进展度量”——即在可见的性能跃升之前就出现的内部结构变化。挑战在于如何将这些方法从受控环境扩展到规模化的大语言模型上。如果我们知道该测量什么,我们就会知道该关注什么。

构建能够检测自身失效——并随之演化的评估系统。随着模型变得越来越具有代理能力,这个问题变得日益紧迫。那些能够编写代码、运行实验、生成数据、辅助训练或评估流程的系统,正在让静态的评估变得越来越脆弱。如果模型能力的提升速度快于人类评估团队更新基准测试的速度,那么评估就必须变得具有自适应性。

具体来说:

  • 监控元信号——基准测试分数的分布是否在改变特征?评估之间的相关性结构是否在发生变化?模型是否正在发展出与你测量维度正交的能力?
  • 追踪所有指标的缩放曲线——不仅仅是损失函数,还包括推理深度、工具使用复杂度、欺骗性能力——并在平滑趋势出现断裂时提高警惕。
  • 更大胆一点:构建自我演化的评估系统——利用模型去探测其他模型的评估系统,随着能力变化自动生成新的测试用例,发现原始评估设计者从未预料到的失效模式。评估套件应该是一个活的系统,与它所衡量的模型共同演化,而不是一份为去年的前沿模型编写的静态检查清单。

问题不在于我们的评估会不会被意外打脸——它们已经被打过很多次了,无论是被真正的相变,还是被我们自己的指标选择所误导。问题在于,我们能否预见到下一次意外的到来。就目前而言,我们做不到。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1-1!中国女足11打10差点输,王霜替补席坐穿才救主,米利希奇轮休玩火,小组第一却提前出线告吹

1-1!中国女足11打10差点输,王霜替补席坐穿才救主,米利希奇轮休玩火,小组第一却提前出线告吹

锐评利物浦
2026-09-17 16:54:22
热身赛:广东战平蒙古联赛冠军!徐杰卢卡发挥出色,宏远两人受伤

热身赛:广东战平蒙古联赛冠军!徐杰卢卡发挥出色,宏远两人受伤

多特体育说
2026-09-17 23:05:28
图片报:克洛普征召埃布努塔利布,摩洛哥对此非常不满

图片报:克洛普征召埃布努塔利布,摩洛哥对此非常不满

懂球帝
2026-09-17 21:01:30
在美国搞996福报,华人老板被FBI抓捕,或入狱20年

在美国搞996福报,华人老板被FBI抓捕,或入狱20年

难得君
2026-09-16 09:02:07
24万买的电车,开了3年半卖7万,车主:换油车加300块油心里踏实

24万买的电车,开了3年半卖7万,车主:换油车加300块油心里踏实

民间胡扯老哥
2026-09-13 01:05:30
马斯克“月球城市”面临致命约束:水资源不可持续,10亿吨水只够百万人用约100年

马斯克“月球城市”面临致命约束:水资源不可持续,10亿吨水只够百万人用约100年

红星新闻
2026-09-15 17:11:29
国民党一人不装了,疯狂攻击大陆,挑战郑丽文,十分不简单

国民党一人不装了,疯狂攻击大陆,挑战郑丽文,十分不简单

DS北风
2026-09-17 16:18:04
成都一网友称携带油纸伞坐地铁被拦下,地铁工作人员回应:属易燃易爆物品,禁止携带进站

成都一网友称携带油纸伞坐地铁被拦下,地铁工作人员回应:属易燃易爆物品,禁止携带进站

扬子晚报
2026-09-17 20:47:16
邓文迪和印度首富夫人合影,“身子微倾,下巴收着”,网友称:整个人的气场直接瘪了

邓文迪和印度首富夫人合影,“身子微倾,下巴收着”,网友称:整个人的气场直接瘪了

丫头舫
2026-09-17 13:11:45
28岁女演员心脏骤停成植物人 昏迷3个月后苏醒 如今连跑8家剧组面试

28岁女演员心脏骤停成植物人 昏迷3个月后苏醒 如今连跑8家剧组面试

闪电新闻
2026-09-17 14:28:30
国内多家大厂赴美适配 iPhone Duo,太双标了!

国内多家大厂赴美适配 iPhone Duo,太双标了!

芝麻科技讯官方号
2026-09-16 09:17:43
不查不知道!原来他也出席敬一丹葬礼,文艺圈大佬,老婆赫赫有名

不查不知道!原来他也出席敬一丹葬礼,文艺圈大佬,老婆赫赫有名

林雁飞
2026-09-17 17:30:03
泰国淘汰6艘中国军舰,百亿大单全送给韩国,中企连标书都没给

泰国淘汰6艘中国军舰,百亿大单全送给韩国,中企连标书都没给

通鉴史智
2026-09-15 10:15:24
发不出工资,很多单位开始“不择手段”了

发不出工资,很多单位开始“不择手段”了

细说职场
2026-09-16 21:27:44
莫言说:“如果一个人对待家人不耐烦态度差,对外人又很客气和善,不是不孝顺,而是因为这三个原因。”

莫言说:“如果一个人对待家人不耐烦态度差,对外人又很客气和善,不是不孝顺,而是因为这三个原因。”

背包旅行
2026-07-29 18:06:59
玄学分析:龙长虎短:无名指长于食指,这类人晚年有两种命运走向

玄学分析:龙长虎短:无名指长于食指,这类人晚年有两种命运走向

卡西莫多的故事
2026-06-08 09:47:53
财经聚焦|平陆运河何以改变西南出海的“经济账本”

财经聚焦|平陆运河何以改变西南出海的“经济账本”

新华社
2026-09-16 21:29:37
美联储加息,对人民币、A股、黄金有何影响?

美联储加息,对人民币、A股、黄金有何影响?

上观新闻
2026-09-17 17:18:46
丈夫离家12分钟遛狗,留2岁幼童独自在家坠亡,妻子打了丈夫三巴掌对方称“再动我一下就报警”;丈夫:理解妻子情绪,我是过错方也很愧疚

丈夫离家12分钟遛狗,留2岁幼童独自在家坠亡,妻子打了丈夫三巴掌对方称“再动我一下就报警”;丈夫:理解妻子情绪,我是过错方也很愧疚

蓬勃新闻
2026-09-17 09:55:52
比特朗普更危险!手握上万亿美元的他,早已成了中国最大的隐患!

比特朗普更危险!手握上万亿美元的他,早已成了中国最大的隐患!

孤城落叶
2026-09-17 02:31:02
2026-09-18 02:35:01
可达鸭面面观
可达鸭面面观
不看新闻就头疼,看了更疼
1742文章数 158747关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

永和豆浆视频被指擦边:女子穿蕾丝吊带 脱黑丝袜洗澡

头条要闻

永和豆浆视频被指擦边:女子穿蕾丝吊带 脱黑丝袜洗澡

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

数码
旅游
教育
时尚
公开课

数码要闻

雷蛇塔洛斯魔蝎V2专业版单手键盘发布,售价1599元

旅游要闻

让双节旅游市场活力更加充分释放

教育要闻

认知篇:顶级留学生会戒掉的几种学生思维!

潮流之向,自有回响——浪潮音乐大赏特别企划

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版