网易首页 > 网易号 > 正文 申请入驻

Agent能力反超Fable 5!DeepSeek V4 Flash靠自验证提升上限,成本仅为1/11

0
分享至

智猩猩AI整理

编辑:金水

大模型会答错,这是常识。

但如果一个模型自己生成的答案里已经藏着正确解,只是它没认出来,那问题就不在"能不能做对",而在"能不能把对的挑出来"。

斯坦福、UC Berkeley、NVIDIA 的团队提出的LLM-as-a-Verifier最近放出的一组实验,把这个想法落了地:

用DeepSeek V4 Flash同时负责"写答案"和"挑答案",在Terminal-Bench 2.1上把系统成功率推到了88%,过了 Claude Fable 5,成本还低约 11 倍。


没有外接更强的 GPT 或 Claude,生成和验证用的是同一个模型。

不让模型报整数分,而是读评分 token 的 logits,对整条概率分布求期望,得到连续分数。

真正拉开差距的,是"多采样几次之后,能不能把那条对的轨迹选出来"。


  • 论文题目:

    LLM-as-a-Verifier: A General-Purpose Verification Framework

01

DeepSeek V4 Flash 的自验证实验

模型能验证自己的输出吗?

问题很直接,一个模型能不能给自己的 rollout当裁判?

在 Terminal-Bench 2.1 上,团队为每个任务用 deepseek-v4-flash 生成5条 mini-swe-agent 执行轨迹,然后用同一个模型当验证器去给这些轨迹打分、排序、选最优。

听起来像是"考生改自己的卷子",但结果并不随机,尽管验证器判的是自己模型的产出,选出的最优轨迹成功率远高于单次生成的 Pass@1。



几个值得品一下的点:

Best-of-3 把 79.4% 抬到 86.5%,Best-of-5 把 78.7% 推到 88.0%,多采样加自验证,是实打实的涨点,不是噪声。

Best-of-5 还有一个更关键的数字,Oracle(理想选择上限)达到 96.6%

说明对绝大多数任务,5 条候选里至少已经有一条成功了。

模型"会做",只是"没选对"。验证器的天花板很高,空间还很大。


成功率被拉到与更强的闭源模型相近水平,而 DeepSeek 一侧单任务成本约0.11 美元,对照模型约1.3 美元——成本不到后者的十分之一。

论文把 Terminal-Bench V2 排行榜上不同模型、不同 Agent 配置跑出的执行轨迹汇总到一起后,发现理想选择器对任务的覆盖率最高能到 98.9%,对的答案大概率就在候选里。


02

连续验证到底

怎么"分得出高下"

标准 LM 评委为什么容易翻车?

常见的 LLM-as-a-Judge,直接让模型吐一个 1–5 的整数分。

问题在两条质量其实差很多的長轨迹,很可能同时拿到 4 分或 5 分。

论文在 Terminal-Bench V2 上测到,单次离散打分的平局率达到 26.7%,超过四分之一的对比,直接判不出胜负。

LLM-as-a-Verifier是一个通用的「验证器框架」,给任意智能体(agent)提供细粒度反馈。核心思想和普通 LLM-as-a-Judge 不同,它不把评分压成一个离散分数。

LLM-as-a-Verifier 不只读最终分数,而是保留每个评分 token 的概率分布,再做概率加权,得到一条连续的验证分数。

就算两个候选都输出"4 分",只要模型对不同档位的置信分布不一样,连续分数照样能把它们拉开。


连续分数本身就能拉开好坏差距。在此基础上,验证还能沿三个方向继续放大:


1、评分粒度 G

把刻度从粗拉到细(比如 1 档到 20 档)。

模型并没有多获得信息,只是解码空间更细了,原先会被四舍五入成同分的邻近判断,现在能落在不同的连续值上。

信号噪比从 0.775 升到 0.799,准确率从 73.1% 到 77.5%。

2、重复评估 K

同一对多评几次再平均,相当于蒙特卡洛估计,方差随次数下降。

单次评估容易被无关特征带偏,多跑几次能压掉这部分噪声。准确率从 74.7% 提到 77.5%(K=1→16)。

3、标准分解 C

长程任务里“对不对”其实混了好几件事。

拆成是否满足需求、输出格式是否正确、日志有没有失败信号,分别评再平均,减少模型只盯最显眼因素就下结论的偏置。

单标准 75.2%–76.4%,三标准合起来 78.3%。

候选多了怎么办?

候选一多,两两比较是 O(N²),5 条还行,几十条就贵了。框架用Probabilistic Pivot Tournament(PPT)把成本压到 O(Nk):

1)环传递:随机哈密顿环先比相邻对,每个候选各当一次 A、一次 B,抵消位置偏好;

2)选枢轴:按环传成绩取前 k 个当枢轴;

3)枢轴锦标赛:非枢轴只跟枢轴比,预算集中在最不确定的头部候选;

4)聚合:把胜场质量归一化,取最高者返回。

重复评估时 A/B 槽位交替,位置偏差再次抵消。


实测 k=3 就略超此前 V1 的结果,k=9 已经接近全量两两比,却少算一大半比较。

03

怎么接入你的电脑

步骤一:安装

pip install llm-verifier

如果要跑最新开发版,克隆仓库后执行

pip install -e

步骤二:准备「验证器后端」

真正关键的是准备验证器后端。

llm_verifier 本身不直接打分,而是调用一个大模型当 verifier。

按仓库说明,需要在环境里配置 DEEPSEEK_API_KEY 或 VERTEX_API_KEY,也可以接一个能返回 logprobs 的 OpenAI 兼容服务。

verifier 必须能返回 logprobs,否则就退回成普通的离散打分。

步骤三:把密钥写进 .env

在项目根目录(或运行目录)创建 .env文件:

OPENAI_BASE_URL=http://localhost:8000/v1

04

总结

生成已经卷到头了,下一程的杠杆,在验证。

真正卡住系统上限的,是验证器还没把它们全挑出来。

5次采样距 96.6% 的理想上限仍有明显空间,下一步最直接的提升,就是把现有候选选得更准。

LLM-as-a-Verifier 最聪明的地方,不是又训了个更大的模型,而是换了个"读模型"的方式,把离散结论变成连续概率,再沿粒度、重复、分解三个维度缩放。

它对做 agent 的人最直接的启发可能是这句:别再让模型给自己盖棺定论,读它的概率,而不是听它的结论。

一个会答错的模型,开始自己给自己挑答案。它挑得还不够完美,但方向已经对了,多采样负责"覆盖到",连续验证负责"认出来"。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
西贝发布待岗通知书:公司正面临巨额亏损,工资降至2540元/月

西贝发布待岗通知书:公司正面临巨额亏损,工资降至2540元/月

识礁Farsight
2026-09-18 15:17:10
河南一数学老师花300多万拍院线电影,上映三天票房不到3万,本人回应:已无力回天

河南一数学老师花300多万拍院线电影,上映三天票房不到3万,本人回应:已无力回天

互联网大观
2026-09-18 17:44:42
手机关掉这个开关,瞬间跟新机一样流畅

手机关掉这个开关,瞬间跟新机一样流畅

辉哥说动漫
2026-09-17 01:27:25
伊朗总统获美国签证参加联大,美国国务院发言人:代表团“不得购买奢侈品”

伊朗总统获美国签证参加联大,美国国务院发言人:代表团“不得购买奢侈品”

红星新闻
2026-09-18 17:30:18
中国男篮vs日本首发:廖三宁、庞峥麟、崔永熙、王俊杰、胡金秋

中国男篮vs日本首发:廖三宁、庞峥麟、崔永熙、王俊杰、胡金秋

懂球帝
2026-09-18 18:18:09
中国男篮决战日本队,首发阵容大调整,如果输球全员都面临淘汰

中国男篮决战日本队,首发阵容大调整,如果输球全员都面临淘汰

宗介说体育
2026-09-18 09:58:07
iPhone Duo 遭遇微信双登录失败,一万六的折叠屏,微信只认它是台手机

iPhone Duo 遭遇微信双登录失败,一万六的折叠屏,微信只认它是台手机

小柱解说游戏
2026-09-18 09:23:40
中美外长这通电话释放出的信息

中美外长这通电话释放出的信息

环球时报国际
2026-09-18 15:33:04
10月拿不出对策,中国就要完蛋?欧盟当众叫板,扬言不计代价报复

10月拿不出对策,中国就要完蛋?欧盟当众叫板,扬言不计代价报复

共工之锚
2026-09-18 00:34:31
可感知、可量化:《饮用水健康与感官品质研究报告》发布会举行

可感知、可量化:《饮用水健康与感官品质研究报告》发布会举行

中国家电网
2026-09-14 17:03:38
美国22岁说唱歌手遇害,在车中遭两辆车夹击并被多名枪手围攻狂扫,身中多枪死亡;目击者称听到超100声枪响,警方现场标记80个以上的弹壳

美国22岁说唱歌手遇害,在车中遭两辆车夹击并被多名枪手围攻狂扫,身中多枪死亡;目击者称听到超100声枪响,警方现场标记80个以上的弹壳

大风新闻
2026-09-18 15:46:25
王鹤棣疯传做阴茎增大术坏死!「诊所急发3点声明」 热搜爆了压不下来

王鹤棣疯传做阴茎增大术坏死!「诊所急发3点声明」 热搜爆了压不下来

ETtoday星光云
2026-09-17 13:51:01
时隔12年进亚运决赛!韩国男篮大胜伊朗 李贤重26+14+7三分

时隔12年进亚运决赛!韩国男篮大胜伊朗 李贤重26+14+7三分

醉卧浮生
2026-09-18 16:53:02
住建部:支持个体工商户、非全日制从业人员以及其他灵活就业人员自愿缴存住房公积金

住建部:支持个体工商户、非全日制从业人员以及其他灵活就业人员自愿缴存住房公积金

每日经济新闻
2026-09-18 13:46:03
31岁精神科女医生辞职送外卖:曾是医学博士 如今换上美团骑手服

31岁精神科女医生辞职送外卖:曾是医学博士 如今换上美团骑手服

快科技
2026-09-18 17:03:04
伯克希尔·哈撒韦任命沃伦·巴菲特为名誉董事长,霍华德·巴菲特任董事长

伯克希尔·哈撒韦任命沃伦·巴菲特为名誉董事长,霍华德·巴菲特任董事长

界面新闻
2026-09-18 18:07:13
泰国代表团拍摄亚运会自助餐,日本人太抠简直是“减脂儿童套餐”

泰国代表团拍摄亚运会自助餐,日本人太抠简直是“减脂儿童套餐”

三叔的装备空间
2026-09-17 23:53:31
星宇股份又出事了。被曝黄河路智能产业园近90%一线工人是劳务派遣临时工,正式工只占10%,且集中在管理岗。

星宇股份又出事了。被曝黄河路智能产业园近90%一线工人是劳务派遣临时工,正式工只占10%,且集中在管理岗。

纯洁的微笑
2026-09-18 12:32:39
本届名古屋亚运会,日本这次带了一个极坏的头!韩国、菲律宾、印度等多国对其表达了强烈不满!

本届名古屋亚运会,日本这次带了一个极坏的头!韩国、菲律宾、印度等多国对其表达了强烈不满!

扶苏聊历史
2026-09-18 14:17:38
30楼窗外突现一陌生男子,自称在修空调,却没穿工装、没系安全绳;业主起疑报警,民警抓获后搜出100余克黄金首饰3000多元现金;已被刑拘

30楼窗外突现一陌生男子,自称在修空调,却没穿工装、没系安全绳;业主起疑报警,民警抓获后搜出100余克黄金首饰3000多元现金;已被刑拘

扬子晚报
2026-09-18 07:34:38
2026-09-18 19:07:00
智猩猩
智猩猩
AI 技术内容与服务平台
135文章数 6关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

日本亚运会又出乌龙 曲棍球赛前给韩国队演奏朝鲜国歌

头条要闻

日本亚运会又出乌龙 曲棍球赛前给韩国队演奏朝鲜国歌

体育要闻

一个角色球员,靠什么在NBA征战17年

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

研发0.25亿理财26亿,敷尔佳豪赌三类器械

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

亲子
家居
艺术
时尚
公开课

亲子要闻

孩子几岁学会系鞋带才不算落后?这些点比技巧更重要

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

15位写实画家,23幅静物作品!

没想到这件事,对我的改变这么大!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版