网易首页 > 网易号 > 正文 申请入驻

斯坦福最新实验:DeepSeek V4 Flash 击败Fable5,且成本降低11倍

0
分享至

一个便宜的开源模型,能击败最顶级的闭源模型么?斯坦福最新的一项实验给出了肯定的答案。

在Terminal-Bench 2.1 上,斯坦福研究人员使用 DeepSeek V4 Flash,让它针对同一个任务生成 5 个候选解决方案,再由同一个模型充当“裁判”,利用 LLM-as-a-Verifier 对这些方案进行评分和排序,最后提交得分最高的答案。


结果,准确率从单次生成的 79% 提升到了 88%,超过了 Claude 最新的 Fable 5。更夸张的是,达到这一效果的成本只有后者的大约 1/11。

这件事真正值得关注的,并不是简单的“DeepSeek 击败 Claude”,而是它展示了一条完全不同的模型能力提升路径。


传统的 Agent 工作方式,往往是模型拿到任务后直接给出一个答案。其问题在于,第一次生成并不一定是模型能力的上限。它可能犯错,也可能在多个可行方案中随机选到一个较差的方案。

如果让模型一次生成 5 个答案,就相当于给它增加了 5 次“尝试机会”。但光有多个答案还不够,因为你还需要知道哪个最好。

这就是 LLM-as-a-Verifier 的核心。

它的思路并不复杂:让大语言模型不仅负责“做题”,也负责“阅卷”。

过去很多评测采用 1~5 分这样的粗粒度评分,让模型给一个答案打分,然后直接拿这个分数判断好坏。

LLM-as-a-Verifier 则进一步把评分做细,例如使用 1~20 的评分尺度,同时不只是看模型最终选择了哪个分数,还利用模型对不同评分结果的概率分布,也就是 logprob,计算出更加细致的期望评分。

简单理解,就是不再问模型:“你觉得这个答案是 1 分还是 5 分?”

而是进一步观察:“你有多大把握认为它是 15 分、16 分、17 分……?”

这样得到的评价信号更加细腻,也更适合拿来比较多个候选答案。


在 DeepSeek 的这个实验里,正是利用这种验证机制,让模型从自己生成的多个答案中进行筛选。

生成和验证使用的是同一个 DeepSeek V4 Flash,但两者扮演的是不同角色:前者负责尽可能多地寻找解决方案,后者负责判断这些方案谁更可靠。

过去提升模型性能,主要依赖训练阶段——增加参数、增加数据、训练更强的模型。

但现在,可以尝试把注意力转向 test-time scaling,也就是测试时扩展。

就是说,模型训练完成之后,在真正解决问题的时候,允许它多花一些计算量。

不仅是生成 ,还要验证、排序 、选择,而且这个过程还可以继续扩展。

比如,不只是生成 5 个答案,可以生成更多;不只验证一次,可以重复验证;不只简单地给答案打分,还可以把任务拆成多个维度分别评价。

这也是 LLM-as-a-Verifier 论文更值得关注的地方。

研究人员发现,验证本身同样可以进行“扩展”。


他们使用更加细粒度的评分、完整的评分概率分布,以及重复评估和任务分解等方法,让验证器提供更丰富的信号。

这些信号不仅可以用于从多个答案中挑选最优解,还可以进一步用于强化学习、测试时扩展以及 Agent 的运行监控。

最终,这套方法在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench 和 MedAgentBench 等多个 Agent 基准上取得了 SOTA。

当然这并不是说,便宜的开源模型超过了最强闭源模型,而是证明了在足够低的成本下,模型可以通过“多生成+自验证”把整体性能推到一个新的水平。

这种思路如果拓展开来,对 AI 大模型的发展能提供怎样不一样的方向呢?

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
不要美化陈锦婷,她不是大学生

不要美化陈锦婷,她不是大学生

叒女紫121
2026-09-10 22:27:51
中央5台直播女篮世界杯时间表:9月12日,CCTV5直播法国PK德国

中央5台直播女篮世界杯时间表:9月12日,CCTV5直播法国PK德国

薇说体育
2026-09-12 15:00:51
劝所有人赶紧戒烟:现在的香烟,和20年前根本不是一个东西

劝所有人赶紧戒烟:现在的香烟,和20年前根本不是一个东西

周哥一影视
2026-09-12 09:26:00
大摩突然预警:明后年楼市跌 17%-35%,这次玩笑开大了

大摩突然预警:明后年楼市跌 17%-35%,这次玩笑开大了

专业聊房君
2026-09-12 13:44:57
苹果高管透露折叠屏泄密,有安卓厂商搞到了宽高比后抄袭!网友调侃:还好没有偷到名字

苹果高管透露折叠屏泄密,有安卓厂商搞到了宽高比后抄袭!网友调侃:还好没有偷到名字

大白聊IT
2026-09-12 00:47:44
库克承认参考华为打谁的脸?刻在骨子里的崇洋,比技术落后更可怕

库克承认参考华为打谁的脸?刻在骨子里的崇洋,比技术落后更可怕

王新喜
2026-09-11 21:04:33
“这个鼻子太优越了”,家长晒无美颜大一女儿哭鼻子,网友被震撼

“这个鼻子太优越了”,家长晒无美颜大一女儿哭鼻子,网友被震撼

熙熙说教
2026-09-12 13:20:24
A股史上最大注销式回购,能否阻挡股价断崖式下跌

A股史上最大注销式回购,能否阻挡股价断崖式下跌

东方豪侠
2026-09-12 15:19:59
单价便宜97%分数还反超,DeepSeek新模型把GPT-5.6按在地上摩擦

单价便宜97%分数还反超,DeepSeek新模型把GPT-5.6按在地上摩擦

不掉线电波
2026-09-12 13:30:12
有时候连错题都一样!双胞胎兄弟同考621分同进武理工相同专业

有时候连错题都一样!双胞胎兄弟同考621分同进武理工相同专业

极目新闻
2026-09-12 15:47:20
吃相难看!被摸臀女生已认怂,恶心一幕却发生了,她的同类人真不少

吃相难看!被摸臀女生已认怂,恶心一幕却发生了,她的同类人真不少

小鋭有话说
2026-09-11 23:47:10
首进大满贯决赛!谢尔顿3-1逆转赢美国德比,PK兹维列夫争冠

首进大满贯决赛!谢尔顿3-1逆转赢美国德比,PK兹维列夫争冠

全景体育V
2026-09-12 11:03:34
iPhone Duo把信号电量合成一个圈,这设计你买账吗?

iPhone Duo把信号电量合成一个圈,这设计你买账吗?

菜但瘾大第一名
2026-09-11 18:11:59
再见了刘翔,再见了樊振东,中国越来越不需要金牌,将迎来新时代

再见了刘翔,再见了樊振东,中国越来越不需要金牌,将迎来新时代

米果说识
2026-09-11 17:27:22
港媒曝钟丽淇患渐冻症,钟丽淇发文回应:恳请大家给予足够空间!

港媒曝钟丽淇患渐冻症,钟丽淇发文回应:恳请大家给予足够空间!

天马幸福的人生
2026-09-12 04:49:39
中国必须高度警惕越南将发生的分裂危机!

中国必须高度警惕越南将发生的分裂危机!

叶老四
2026-08-31 08:51:57
没想到,董建华去世仅1天,梁振英因一个举动,实现了口碑暴增

没想到,董建华去世仅1天,梁振英因一个举动,实现了口碑暴增

和风聊历史
2026-09-11 14:57:40
马斯克重磅预言:只剩5年!人类千年的吃苦内卷规则彻底终结

马斯克重磅预言:只剩5年!人类千年的吃苦内卷规则彻底终结

岸卡卡
2026-09-11 10:52:51
“我已经蠢的不像人了!”女大学生报道路上崩溃,网友:社会化程度太低了!

“我已经蠢的不像人了!”女大学生报道路上崩溃,网友:社会化程度太低了!

林林先生
2026-09-11 07:40:03
今日韩国前总统无罪释放!第一夫人悔不当初,称自身财富尽数丧失

今日韩国前总统无罪释放!第一夫人悔不当初,称自身财富尽数丧失

梦在深巷aqa
2026-09-12 10:11:02
2026-09-12 17:27:00
AI先锋官 incentive-icons
AI先锋官
AIGC大模型及应用精选与评测
668文章数 104关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

五旬夫妻村口遭醉酒公职人员驾车撞击身亡 被认定次责

头条要闻

五旬夫妻村口遭醉酒公职人员驾车撞击身亡 被认定次责

体育要闻

老鹰真正的底气来自于什么?

娱乐要闻

港媒曝钟丽淇疑患渐冻症,本人发文

财经要闻

继房子茅台后 中产的第3个"神话"破灭了

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

游戏
时尚
本地
健康
公开课

索尼PS5世代仅4个新IP还死了俩 PS4世代有20多个

专栏|一位“皮笑肉不笑”初学者的自述

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

手脚发麻口齿不清?也可能是中风!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版