网易首页 > 网易号 > 正文 申请入驻

「自验证」框架让开源模型反超 Fable 5,冲上 GitHub 热榜

0
分享至



随着开源模型能力不断提升,它们已经能够以极低的成本生成多个高质量候选方案,并进一步利用模型自身对这些结果进行验证、打分和筛选。斯坦福团队最新实验发现,使用 DeepSeek V4 Flash + LLM-as-a-Verifier 进行「自验证」,可以在 Terminal-Bench 2.1 上超越 Claude Fable 5,同时整体成本低约 11 倍



  • GitHub 代码:https://github.com/llm-as-a-verifier/llm-as-a-verifier

具体来说,团队首先让 DeepSeek V4 Flash 针对同一个任务生成 5 条候选 Agent 轨迹。随后,不引入任何能力更强的闭源模型,而是继续使用同一个 DeepSeek V4 Flash,通过 LLM-as-a-Verifier 验证框架对这些候选结果进行验证、打分和排序。最终,DeepSeek V4 Flash 在 Terminal-Bench 2.1 上的任务成功率从:79% → 88%

值得注意的是,这里的成本并不只是验证成本,而是同时包含两部分:生成 5 个候选方案的成本,以及使用 DeepSeek V4 Flash 进行验证和筛选的成本。「自验证」确实会消耗更多 Token,但由于开源模型的 Token 成本足够低,即使加入额外的采样和验证,整体单任务成本依然显著低于闭源前沿模型。并且,上述成本已经按照 DeepSeek 涨价后的最新价格计算。

在延迟方面,自验证也不意味着需要串行等待 5 次完整生成。多个候选方案可以并行生成,大部分验证过程同样可以并行执行。在并发资源充足的情况下,整体延迟大致相当于:耗时最长的一次 Agent rollout + 少数几轮验证。因此,候选数量增加并不会让端到端延迟按比例增长。



随着实验结果发布,LLM-as-a-Verifier 在 X 上引发广泛讨论,同时也冲上了GitHub Trending 热榜#2。与此同时,开源社区已经开始在 DGX Spark 等本地硬件上部署GLM、DeepSeek 等模型,并复现类似的自验证结果。这可能会成为本地 AI 非常重要的一条发展路线:当本地和开源模型足够便宜时,与其把所有希望押在一次生成上,不如通过「多次采样 → 自我验证 → 选择最优结果」,用更多廉价的推理计算持续换取更高的能力。

本项目由斯坦福大学 CS 博士生 Jacky Kwok 负责。通讯作者包括 Ion Stoica(UC Berkeley 教授、Databricks 联合创始人)、Azalia Mirhoseini(斯坦福大学教授,曾任职于 DeepMind 与 Anthropic)、Marco Pavone(NVIDIA AI 与自动驾驶研究总监)以及 Chelsea Finn(斯坦福大学教授、Physical Intelligence 联合创始人)。



  • 项目网站:https://llm-as-a-verifier.com
  • API 文档:https://llm-as-a-verifier.com/docs
  • GitHub 代码:https://github.com/llm-as-a-verifier/llm-as-a-verifier
  • 论文:https://arxiv.org/pdf/2607.05391
  • 联系方式:jackykwok@stanford.edu

更多关于 LLM-as-a-Verifier 的实验结果与分析详见下文:

方法概述

LLM-as-a-Verifier 是一个通用验证框架,无需额外训练,即可为不同模态的模型输出提供细粒度反馈。与传统 LLM-as-a-Judge 只输出单一离散分数不同,LLM-as-a-Verifier 利用了评分 Token 的完整 logit 概率分布,从而显式刻画模型在评价过程中的不确定性,并使验证能力能够沿着三个维度进一步扩展:评分粒度(score granularity)、重复评估(repeated evaluation)以及评价标准拆分(criteria decomposition)。由此得到的细粒度反馈可以进一步用于Test-Time Scaling、任务进度追踪以及强化学习。



1)推理阶段扩展

当 LLM-as-a-Verifier 被用作轨迹级 Reward Model,对多个候选解进行验证和排序时,在多个不同领域的 benchmark 上均取得了领先结果:Terminal-Bench V2 (86.5%), SWE-Bench Verified (78.2%), RoboRewardBench (87.4%), and MedAgentBench (73.3%)。

这些结果表明,同一套验证框架可以用于软件工程、机器人以及医疗 Agent 等不同任务,而无需针对每一个领域单独训练新的 Reward Model。



2)强化学习

LLM-as-a-Verifier 也可以直接作为强化学习中的稠密奖励信号(dense reward)。实验显示,将其反馈接入 SAC 和 GRPO 后,可以在机器人控制与数学推理任务中提升训练的样本效率。



3)代码生成进度追踪

LLM-as-a-Verifier 给出的评分与代码 Agent 的实际任务进展之间存在明显相关性。随着代码生成和任务执行逐步接近正确解,Verifier 的分数通常也会随之提升。这意味着它不仅可以用于比较最终的多条候选轨迹,也可以用于实时追踪 Agent 是否正在朝正确方向推进



4)机器人任务进度追踪



视频链接:https://mp.weixin.qq.com/s/xJS1GOm_P6I6Qu6mGHfnLQ

类似的现象也出现在机器人任务中。在一次完整的 robot rollout 过程中,LLM-as-a-Verifier 能够生成平滑、与时间进度对齐的奖励信号,并能够区分多种失败模式,例如:

  • 机器人理解了错误的任务意图
  • 抓取位置不准确
  • 动作执行偏离目标

API:几行代码即可接入自己的任务

LLM-as-a-Verifier 已经提供开源 Python API,可以直接安装:

pip install llm-verifier

  • API 文档:https://llm-as-a-verifier.com/docs/references/api.html



研究动机:Agent 往往「会做」,但不知道哪一次做对了

LLM-as-a-Verifier 背后的一个核心观察是:很多 Agent 其实已经「知道」如何完成任务,真正的问题是,它们不知道自己生成的哪一个答案才是正确的。

以 Terminal-Bench 为例,如果针对同一道任务反复采样大量轨迹,例如每道题生成100 条候选轨迹,模型的 Pass@100 可以显著超过 Claude Mythos,并接近解决整个 benchmark。真正困难的问题变成了:如何从大量候选轨迹中,可靠地找出正确的那一个?这也是 Verification Scaling 希望解决的核心问题。



核心问题:平局

最简单的方法是让 LLM-as-a-Judge 对不同候选解进行评分。但问题在于,当候选方案都比较复杂、质量又比较接近时,传统 Judge 往往无法提供足够细粒度的区分能力。例如,在 Terminal-Bench V2 上,使用离散评分的标准 LLM-as-a-Judge 会出现高达 27% 的平局(tie)。两个质量明显不同的候选方案,可能都会被模型打成同一个分数。



案例分析:利用评分 Token 的概率分布

和更高的评分粒度打破平局

LLM-as-a-Verifier 的关键思路之一,是不再只读取模型最终输出的那个离散评分,而是进一步利用评分 Token 的完整 logit 概率分布。通过对评分分布求期望,可以把原本离散的评分转化为更加连续、细粒度的概率性评价。

以 query-optimize 任务为例,传统离散 Judge 几乎总是给两条轨迹相同的分数。而 LLM-as-a-Verifier 利用评分 Token 的概率分布以及更高的评分粒度(1-20)后,在 100 次比较中有 77 次正确选出了更好的轨迹,同时没有出现一次平局。



验证 Scaling Law:多个评估维度应协同扩展



这种概率化的评价方式,使得 Verification 本身也可以像生成一样 Scale。与 Kaplan 等人提出的 Scaling Laws 类似:数据规模、模型规模和计算量需要协同扩展,才能获得最优性能。

团队的结果表明,评分粒度(score granularity)、重复评估(repeated evaluation)和评价标准(criteria decomposition)同样能够带来互补的性能增益,因此也应该进行联合扩展(scale in tandem)

示例 Prompt 与细粒度奖励



排序算法:复杂度从 O (N²) 降至 O (Nk)

当候选数量不断增加时,另一个现实问题是验证成本。如果对 N 个候选方案进行完整的两两比较,需要进行大约 O (N²) 次验证。随着 N 增大,这种方法的成本会迅速上升。

为此,团队进一步提出了一种更加高效的候选选择算法。

该方法利用 Verifier 输出的 preference probability,只需要让每个候选方案与少量 pivot candidates 进行比较,就能够近似完成整个候选集合的排序。最终,选择复杂度可以从:O (N²) → O (Nk) 其中 k 是一个较小的 pivot 数量。



总结

随着开源模型能力不断提升、推理成本持续下降,「自验证」正在成为一种越来越可行、也越来越经济的能力扩展方式。Verification Scaling 也有可能成为继 Pre-training、Post-training 和 Test-Time Scaling 之后,另一条重要的 Scaling 路线。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
办完离婚大喊自由,5个月后求复婚被拉黑:这种“潇洒”代价太蠢

办完离婚大喊自由,5个月后求复婚被拉黑:这种“潇洒”代价太蠢

寻墨阁
2026-09-15 11:06:15
王健林这辈子最失败、也最后悔的投资,恐怕就是分别给了王思聪、张艺谋和董明珠每人5个亿

王健林这辈子最失败、也最后悔的投资,恐怕就是分别给了王思聪、张艺谋和董明珠每人5个亿

谈史论今1
2026-08-16 20:23:49
460万粉车评大 V “拜托了老司机” 被封!汽车圈为什么接连翻车?

460万粉车评大 V “拜托了老司机” 被封!汽车圈为什么接连翻车?

沙雕小琳琳
2026-09-16 05:53:29
41岁Coco被曝:回河南老家相亲了好几次,全黄了!大家听到她和那个人的感情经历后,都说了一句相同的话...

41岁Coco被曝:回河南老家相亲了好几次,全黄了!大家听到她和那个人的感情经历后,都说了一句相同的话...

美芽
2026-08-06 12:35:35
她连续5次上春晚,却被恩师骗同居流产,如今58岁无依无靠太唏嘘

她连续5次上春晚,却被恩师骗同居流产,如今58岁无依无靠太唏嘘

往史过眼云烟
2026-08-24 22:01:09
“庆幸我没考上211”,湖南女孩大学报到第一天就后悔:落差太大了

“庆幸我没考上211”,湖南女孩大学报到第一天就后悔:落差太大了

妍妍教育日记
2026-09-15 17:54:20
1050亿美元!张一鸣登顶亚洲首富,靠的不是抖音

1050亿美元!张一鸣登顶亚洲首富,靠的不是抖音

闺蜜财经
2026-09-17 00:14:01
71岁老头哄骗保姆同居10年,每月给她15500元,分手那刻老头不但不认账,翻脸就告保姆“私闯民宅”!

71岁老头哄骗保姆同居10年,每月给她15500元,分手那刻老头不但不认账,翻脸就告保姆“私闯民宅”!

黎兜兜
2026-09-15 23:10:04
任天野夫妇现身学校看儿子表演,56岁硬汉一身正气,儿子眉眼像极妈妈

任天野夫妇现身学校看儿子表演,56岁硬汉一身正气,儿子眉眼像极妈妈

风月得自难寻
2026-09-16 14:53:00
科大讯飞出轨女主更多照片曝光:她长得娇小可爱,丈夫应该再给她一次机会

科大讯飞出轨女主更多照片曝光:她长得娇小可爱,丈夫应该再给她一次机会

汉史趣闻
2026-09-01 13:47:29
意大利汽车协会提议:中国汽车在欧洲卖到8%,必须征收80%关税!

意大利汽车协会提议:中国汽车在欧洲卖到8%,必须征收80%关税!

素衣读史
2026-09-16 05:56:20
王楚钦再创历史,将成第一个把世界第一拱手送给日本的国乒运动员

王楚钦再创历史,将成第一个把世界第一拱手送给日本的国乒运动员

人类的关注
2026-09-06 04:32:21
今夜,全球屏息!半导体、光通信、存储芯片,集体暴涨!油价,暴跌

今夜,全球屏息!半导体、光通信、存储芯片,集体暴涨!油价,暴跌

中国基金报
2026-09-17 00:54:18
匿名现役美国军人首次公开中东多处美军基地遭伊朗袭击照片:建筑与装备大面积损毁,“我们眼睁睁看着它们被摧毁,任由别人往脸上挥拳”

匿名现役美国军人首次公开中东多处美军基地遭伊朗袭击照片:建筑与装备大面积损毁,“我们眼睁睁看着它们被摧毁,任由别人往脸上挥拳”

政知新媒体
2026-09-16 08:30:59
泛亚铁路绕过越南的后遗症,终于在2026年彻底爆发!眼看邻居们搭上中国经济快车,越南军方直接拔枪下场,重兵直逼西南要道

泛亚铁路绕过越南的后遗症,终于在2026年彻底爆发!眼看邻居们搭上中国经济快车,越南军方直接拔枪下场,重兵直逼西南要道

回京历史梦
2026-09-16 02:10:03
500万粉丝王宁翻车,不是演技过火,而是探店这门生意从来没变过

500万粉丝王宁翻车,不是演技过火,而是探店这门生意从来没变过

华文商讯
2026-09-04 12:58:27
5天两大重磅信号!祖国统一,已经迈入落地实操阶段

5天两大重磅信号!祖国统一,已经迈入落地实操阶段

再战五百回合
2026-09-16 14:26:05
非必要不做肠镜?医生提醒:只要做过肠镜,这7件事一定要多注意

非必要不做肠镜?医生提醒:只要做过肠镜,这7件事一定要多注意

叙说医疗健康
2026-07-25 06:00:22
等我老了也要这么打扮:白发不染、不穿老头衫,反而绅士又年轻

等我老了也要这么打扮:白发不染、不穿老头衫,反而绅士又年轻

白宸侃片
2026-09-14 10:52:47
一名地下党员躲进茅厕,敌人经过时,外面群众故意抱怨:这人蹲得也太久了

一名地下党员躲进茅厕,敌人经过时,外面群众故意抱怨:这人蹲得也太久了

我不是沃神
2026-09-15 08:50:03
2026-09-17 09:28:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14007文章数 142733关注度
往期回顾 全部

科技要闻

赛力斯全面接盘,华为真的“撤”了吗?

头条要闻

医学生坠亡事件反转 媒体:造谣者把网友玩弄于股掌

头条要闻

医学生坠亡事件反转 媒体:造谣者把网友玩弄于股掌

体育要闻

对话西甲联盟高管:西班牙足球到底强在哪?

娱乐要闻

乔任梁去世十周年,陈乔恩悼念

财经要闻

美联储加息!沃什重磅发声

汽车要闻

激光雷达+EVA机器人+爆胎稳行 星瑞L PLUS预售限时价11.57万起

态度原创

时尚
艺术
旅游
数码
手机

8年没换过|| 每次“垮脸”都靠它救,这笔小投资已值回本

艺术要闻

这才是国画!刘佰玥“西遇”山水,治好了我的精神内耗!

旅游要闻

秋日北京怎么逛?首博看美洲大展,法源寺寻丁香文脉

数码要闻

64位门槛落地:苹果watchOS 27开始筛选不兼容第三方应用

手机要闻

初探苹果iOS 27“轻触即兑换”礼品卡体验:无需刮涂层

无障碍浏览 进入关怀版