网易首页 > 网易号 > 正文 申请入驻

HarnessEval:新的评测时代,用 Harness 开启

0
分享至

评测,定义技术的品味。

一项技术能走多远,往往取决于我们用什么尺子衡量它。评测从来不只是检验实验结果,更是在为前沿探索设定坐标。然而,在面向物理世界的 RSI(Recursive Self-Improvement)进程中,世界模型始终缺少一把可靠的尺子。尤其面对物理因果、几何一致性与观测真实感,现有评测方式仍难给出稳定、可信的自动判断。与之相比,人类对于生成内容中的异常往往极为敏感:物体是否凭空消失?碰撞后的运动是否合理?场景是否突然发生变化?这些判断对人而言近乎本能,却始终难以被AI自动化实现。现有的 benchmark 也很难让人看清模型到底错在哪里、又为什么错。

在 MirroS,我们首次将 LLM 生态中的重要概念,Harness,引入评测领域。

Harness 并非简单的代码封装,而是一套可靠的执行框架。它将复杂的人类工作流程,例如问题分解、工具调用与推理验证,组织成清晰、可执行的步骤,并由此支撑完整的智能体工作流。人类评测,本质上也是一套工作流。当我们评估一个生成的世界时,我们并非简单地扫一眼图像,而是在不自觉中完成一系列复杂流程:定位物体、追踪其在时间中的存在与变化,判断动作是否合理,再核验其中的因果关系、几何约束和物理规律。我们将这一过程通过Harness自动化为一个agentic benchmark:由一个 agent 统筹全局,根据具体案例动态派生多个专业 subagent,并为它们提供相应的上下文和诊断工具,从不同角度审视模型输出。这套 evaluation harness 就像一位福尔摩斯:它不会依据单一现象仓促下结论,而是不断寻找线索、交叉验证证据,并将分散的信息组织成一条完整的推理链,最终形成判断。

评测由此从一套静态问答规则演化为一个能够主动寻找证据、完成判断的智能系统。其核心不是一条固定的评测流水线,而是一组可以被按需调用、组合与递归展开的评测能力:

  • 规划路径:根据案例确定需要的评测方式;

  • 拆解问题:调度多个 subagent 逐层分解问题;

  • 理解意图:识别待执行动作及其预期的变化;

  • 搜寻证据:定位与判断相关的线索;

  • 调用工具:按需使用测量与推理工具;

  • 形成结论:组织完整的证据与推理链。


HarnessEval-W: 将HarnessEval应用于World Model

今天,我们将 World Model 当作 HarnessEval 试验田,并正式开源 HarnessEval-W,也希望邀请社区共同参与构建这一新的agentic benchmark 工作流。我们首先将世界模型的核心能力拆解为三个评测维度:观测质量、状态转移正确性与世界持续性,并围绕这三个维度构建我们的整体评测体系。

评测的角度

参考已有研究中的常见定义,我们将物理世界模型描述为:

根据历史观测与用户动作,预测世界未来的状态。

凡是具备这一能力的模型,无论采用何种生成架构,都可以纳入 HarnessEval-W 的评测范围,包括双向视频扩散模型(bidirectional video diffusion models)、自回归视频模型(autoregressive video models)等。这一形式化描述也给出了 HarnessEval-W 的基本评测逻辑:世界是否被正确呈现,动作是否引发了正确的状态转移,以及这个世界能否在时间中保持持续而一致。由此,自然得到以下三个核心评测维度。

1. 观测质量

衡量模型输出的视觉观测是否可信。它关注生成视频本身在感知层面的质量,包括:视觉连续性、结构合理性与真实感。

2. 状态转移正确性

关注模型是否能够在正确的时间,以正确的方式响应给定的动作,并使世界状态随之发生符合预期的变化。我们进一步考虑三种类型的状态转移:探索式转移(Exploratory Transition)主要对应观察者在世界中的移动,例如改变相机位置、视角或观察区域。意图式转移(Intentional Transition)指用户主动要求改变某个实体、关系或事件。例如移动一个物体、打开一扇门,或者要求某个角色执行特定动作。物理转移(Physical Transition)关注施加物理控制之后,世界是否按照合理的物理规律演化,例如碰撞、推动、掉落、弹跳或其他动力学过程。

3. 世界持续性

关注随着世界不断演化,模型是否维持了一个持续存在、内部一致的世界。我们重点关注三类典型场景。抗漂移能力(Drift Resistance):测试在长时间生成中,世界的整体布局、风格和对象外观是否保持稳定,而不会随着生成时间增加逐渐发生无意义漂移。重访一致性(Revisit Consistency):当观察者暂时离开某个地点或物体,随后再次返回时,其状态与属性是否仍与此前保持一致。画外演化(Offscreen Evolution):当一个动态过程暂时离开视野后,是否仍能按照时间与物理规律继续演化,而不是在不可见时被冻结、重置或任意改变。世界持续性并不意味着世界中的所有内容都必须保持不变。它要求稳定属性保持一致,同时动态状态也必须沿着连续、合理的轨迹演化。

基于Harness的评测系统

世界模型的评测天然高度依赖具体情境上下文。不同案例可能对应完全不同的环境、动作类型、时间结构与观测状态,因此,很难依靠一组固定问题或静态指标覆盖所有情况。

HarnessEval-W 的核心是一个能够动态制定评测策略的智能体。对于每一个案例,它首先理解当前世界与评测目标,随后规划评测路径;调度具有不同专业能力的子智能体,并结合它们搜集到的证据,逐步形成可验证的评分判断。整个评测过程都会根据当前具体世界调整。换言之,HarnessEval-W 并不预设一条固定的评测流程,而是让评测路径随案例本身动态生成。它不仅需要回答“这个结果是否正确”,还要进一步判断:我们收集的证据,是否真的足以回答当前的评测问题?由此,HarnessEval-W 能够为每一个案例提供一种可解释、复现且按需定制的评测过程。

Skill 选择

评测的第一步,不是立即开展问答打分,而是先确定:这个案例究竟应该问什么问题?HarnessEval-W 首先理解当前评测案例的上下文与目标,再调用有资格、有能力评估这个案例的 skill。例如,在机器人操作场景中,动作是否正确执行、是否遵循合理物理规律,往往比画面是否具有“电影感”更重要。HarnessEval-W 不会机械地对所有案例套用完全相同的评测指标,而会根据场景选择真正相关的评测能力。


Skill 拆解

选定评测 skill 后,系统会把它继续拆成更小、更明确、更易测量的子问题,再分别交给合适的子智能体或工具。例如,要判断一次碰撞是否合理,HarnessEval-W 会继续追问:目标物体在哪里?它们是否在正确的时间发生接触?碰撞前后的速度如何变化?目标追踪、时序验证和速度计算等工具将分别寻找答案。各个子智能体返回的证据最终由主智能体统一汇总、验证,并形成最终结论。如果问题仍然过于复杂,子智能体还可以继续调度新的子智能体,层层拆解,直到每项任务都足够明确,可以直接通过工具或视觉证据完成验证。


从单一分数走向可追溯的证据链

HarnessEval-W 的最终目标并不仅仅是输出一个数字得分。我们希望 benchmark 最终形成一棵层级式的证据树(evidence tree),完整记录到底测了什么、哪个具体工具提供了视觉证据、以及支撑最终分数的完整逻辑链。有了这条可执行、可追溯、可验证的证据链,研究者不仅能准确定位错误来源,也能据此改进下一阶段的模型设计与训练。

评测数据集的构建


一个真正有效的 benchmark,必须覆盖足够复杂、足够多样的环境,才能持续探索世界模型的能力边界。为此,我们同样采用一套 agentic pipeline 来构建评测案例,让 benchmark 能够规模化扩展。

整个流程从预定义的场景分类体系(scene taxonomy)开始。我们首先采样世界的初始配置,确定环境、物体、空间结构、视觉风格与观察视角等属性;随后再为案例选定评测维度,尤其是前文定义的状态转移与世界持续性指标。

根据这些条件,一个图像生成 agent生成世界的初始帧;动作规划 agent随后理解画面内容,并围绕目标评测维度设计具体动作。例如,如果我们需要测试重访一致性,规划 agent 就可以设计一条“先离开当前区域,再绕行返回原位置”的相机轨迹。最后,我们引入一个独立的验证 agent进行质量控制。它会同时检查初始图像与动作设计,确认环境、前景、背景和动作是否彼此协调。未通过验证的候选案例会被自动退回并重新生成,直至满足评测要求。

通过这一闭环流程,benchmark 得以持续扩展,同时保持必要的复杂性与可验证性。

What's Next:让 Agentic Benchmark 持续进化

世界在进化,评测也应随之进化。

评测从不该是一套静态评测标准。随着世界模型不断进入更复杂的场景、展现更强的能力,评测体系本身也必须同步拓展自己的边界。HarnessEval-W 只是我们探索通过 Harness 实现 agentic benchmark 这一新范式的起点。作为一个开源项目,我们也诚挚邀请社区中的研究者与开发者一起参与进来,让 agentic benchmark 在真实的协作与迭代中不断成长。

接下来,我们将重点关注三个方向:

  1. 测试时扩展(Test-Time Scaling)

LLM 在推理时会生成复杂的推理轨迹,并借助 MCP 等外部工具完成长时程任务,评测过程本身也必须获得相应的 scaling 能力。传统 benchmark 往往默认每个样本的评测成本固定,而 agentic benchmark 则允许我们在test time 投入更多计算资源:评测时可以执行更深的搜索、多步验证与工具调用。随着被测试模型越来越强,评测系统也需要通过更多推理和验证计算同步提升自身能力,使评测模型的能力始终足以追上前沿生成模型。

  1. 技能库的扩展(Scaling Skill Libraries)

未来的世界模型将覆盖更广泛的应用场景,并生成包含更复杂物理过程和更细粒度物理细节的环境。因此,agentic benchmark 模型同样需要拥有不断扩展的能力集合。我们将持续搭建丰富的技能库(skill library):当模型模拟更精细的物理与更多样的场景时,评测智能体可以从这个不断增长的库中动态检索并组合专门技能,准确评估生成世界中的物理理解能力。benchmark 的能力不再被写死在一套固定代码中,而能够随着技能库的增长持续扩展。

  1. 自回归改进(RSI)

更进一步,我们希望 benchmark 本身具备自我改进能力。当 HarnessEval-W 在评测前沿世界模型时遇到一个分布外(OOD)场景,它不应该只是简单地给出一个低置信度分数。相反,系统首先应该:

Evaluate the Evaluator ,先评估自身。

它需要判断:当前的不确定性究竟来自被评测模型,还是因为自身缺少相应的 skill?如果发现内部能力缺口,系统就可以通过引入外部的新 skill、学习新的工具使用方式、甚至通过自主探索构建新的评测能力,进一步扩展自己的技能库。新的能力随后重新进入评测 Harness,支持未来更加复杂的评测任务。

我们希望 HarnessEval-W 所开启的,不只是一套新的世界模型 benchmark,而是以 Harness 重新定义 benchmark 范式:能够推理、能够验证,也能够与被评测对象一同进化

让 benchmark 成为技术的驱动者

让 harness 成为认知的引擎

完成 RSI 的智能飞轮

项目主页:https://mirros-lab.github.io/HarnessEval-W

论文:https://arxiv.org/abs/2608.16859

代码:https://github.com/mirros-lab/harnesseval-w

全文 Blog : https://mirros.ai/blog/harnesseval


Join us: talent@mirros.ai

Business Contact: business@mirros.ai

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

娱你同欢
2026-08-30 18:30:43
泽连斯基警告:所有航空公司不要飞越俄罗斯上空,俄空域不再安全!普京:属于“国家恐怖主义” 将回应,不会同 “恐怖分子”谈判

泽连斯基警告:所有航空公司不要飞越俄罗斯上空,俄空域不再安全!普京:属于“国家恐怖主义” 将回应,不会同 “恐怖分子”谈判

每日经济新闻
2026-09-02 21:35:47
美国地勤不拔油管扯爆国航油箱?国航回应:CA982航班在纽约肯尼迪国际机场地面加油作业时,加油车非正常移动,导致飞机相关部件损伤

美国地勤不拔油管扯爆国航油箱?国航回应:CA982航班在纽约肯尼迪国际机场地面加油作业时,加油车非正常移动,导致飞机相关部件损伤

潇湘晨报
2026-09-02 18:04:59
别再逼娃9点10点睡觉!2026科学结论:宝宝真正黄金入睡点是这个

别再逼娃9点10点睡觉!2026科学结论:宝宝真正黄金入睡点是这个

另子维爱读史
2026-09-03 20:32:19
美国军力有多强?美专家曾言:若动真格,全球联合起来也打不过

美国军力有多强?美专家曾言:若动真格,全球联合起来也打不过

墨策史
2026-09-03 20:10:35
福建仙游县突发山洪,一栋三层民房被洪水冲垮;镇政府:无人员伤亡;当地发布暴雨红色预警

福建仙游县突发山洪,一栋三层民房被洪水冲垮;镇政府:无人员伤亡;当地发布暴雨红色预警

大风新闻
2026-09-03 13:48:09
建议中年女人:阔腿裤下面别配小白鞋,学叶童穿这“秋鞋”更高级

建议中年女人:阔腿裤下面别配小白鞋,学叶童穿这“秋鞋”更高级

时尚穿搭生活馆
2026-09-03 20:31:15
曾泽生率部起义后妻子李律声和三个孩子被抓,蒋介石下令严加处置,滇军同乡调动重兵强行劫狱

曾泽生率部起义后妻子李律声和三个孩子被抓,蒋介石下令严加处置,滇军同乡调动重兵强行劫狱

磊子讲史
2026-09-02 14:09:42
造谣抹黑中国,阿根廷官员被要求向国会解释

造谣抹黑中国,阿根廷官员被要求向国会解释

环球时报国际
2026-09-03 19:24:22
50岁林心如在九寨沟拍摄被偶遇, 原相机无美颜,导游:本人更美!

50岁林心如在九寨沟拍摄被偶遇, 原相机无美颜,导游:本人更美!

可乐谈情感
2026-09-03 06:46:19
菲律宾前教育部幕僚长:萨拉·杜特尔特将上亿巨款转给安全官员

菲律宾前教育部幕僚长:萨拉·杜特尔特将上亿巨款转给安全官员

亚太观澜
2026-09-03 20:45:05
曝景甜与孙宇晨闹掰的真相:男方设局想套牢她,5000万美金是房款

曝景甜与孙宇晨闹掰的真相:男方设局想套牢她,5000万美金是房款

生命之泉的奥秘
2026-08-29 20:53:20
贾玲又胖起来,本人回应:实在维持不住,网友:我们玲儿又回来了

贾玲又胖起来,本人回应:实在维持不住,网友:我们玲儿又回来了

喜欢历史的阿繁
2026-09-02 09:16:34
3300万粉丝网红,偷税被罚347.7万元

3300万粉丝网红,偷税被罚347.7万元

第一财经资讯
2026-09-03 19:05:43
“沙德尔”成台风界“老登”,连续三次登陆后,大概率将在广东内陆或近海逐渐消散

“沙德尔”成台风界“老登”,连续三次登陆后,大概率将在广东内陆或近海逐渐消散

三湘都市报
2026-09-03 19:39:11
出大事了!伊朗总统开会还没回国,亲生儿子就要被革命卫队定罪?

出大事了!伊朗总统开会还没回国,亲生儿子就要被革命卫队定罪?

温读史
2026-09-03 04:42:26
足协杯四强出炉!上半区谁赢谁冠军?海港势头正盛,下半区出黑马

足协杯四强出炉!上半区谁赢谁冠军?海港势头正盛,下半区出黑马

祥谈体育
2026-09-03 20:15:13
“我是医院纪委书记,孩子妈是学院副处长”,家长在班级群自报干部身份,最新进展:保定市卫健委称纪检组已介入;保定教育局:系个人行为

“我是医院纪委书记,孩子妈是学院副处长”,家长在班级群自报干部身份,最新进展:保定市卫健委称纪检组已介入;保定教育局:系个人行为

都市快报橙柿互动
2026-09-03 13:25:46
女子拉萨旅游花8万买藏刀,4年后重游店主见刀傻眼:这次竟要30万回收?

女子拉萨旅游花8万买藏刀,4年后重游店主见刀傻眼:这次竟要30万回收?

坠入二次元的海洋
2026-09-01 11:52:06
深圳校服火“出圈”!全市统一,企业自由竞争,价格杀到几十元

深圳校服火“出圈”!全市统一,企业自由竞争,价格杀到几十元

界面新闻
2026-09-01 21:46:36
2026-09-03 21:35:00
AI异类 incentive-icons
AI异类
从硅谷到中关村,AI信息与测评
248文章数 11关注度
往期回顾 全部

科技要闻

大模型扎堆!谷歌刚发,Meta就跟上

头条要闻

乌克兰两大情报机构街头交火 冲突爆发的根本原因披露

头条要闻

乌克兰两大情报机构街头交火 冲突爆发的根本原因披露

体育要闻

梅西:巴萨10号与阿根廷10号

娱乐要闻

王宝强携女友回工作室!相恋8年仍未婚

财经要闻

章子怡套现3亿 上美拿什么补韩束的缺?

汽车要闻

宾利托卡尔性能揭晓 电驱时代释放品牌史上最强动力

态度原创

艺术
房产
时尚
数码
游戏

艺术要闻

总投资107亿,“西南第一高楼”施工高度已达365米!

房产要闻

投资50亿!三亚又一重大配套,方案曝光!

“卡普里裤”今年秋天又流行回来了,这样穿时髦又显高!

数码要闻

9999元!宏碁推出掠夺者XB253Q U1显示器:1080P/1000Hz

仙侠养女儿RPG《仙乡小千金》试玩Demo上线

无障碍浏览 进入关怀版