网易首页 > 网易号 > 正文 申请入驻

GUI Agent奖励模型总判错,浙大联合小米用一套自适应评分表解决了!

0
分享至

智猩猩AI整理

编辑:金水

这两年 GUI Agent 很火,训好它们或筛优质轨迹都离不开结果奖励模型(ORM),给执行轨迹打 0/1,判断是否成功。

但现有 GUI 奖励验证器经常判错,问题出在构建成功标准的两种方式,其一静态模板稳定但太通用,只问“任务完成没”,不关心具体对象、数值、范围和格式;其二隐式推理灵活但无清晰边界,常漏关键细节或自己加戏、过度严苛。

核心矛盾是验证器打分前根本没拿到一条贴合当前任务的判断标准。

针对这个"标准不够任务自适应(task-adaptive)"的缺陷,浙江大学联合小米(MiLM Plus)提出 ADAPT RUBRIC——一个粗到细(Coarse-to-Fine)的 Rubric 框架,专门解决"怎么从一条用户指令里,生成贴合它的判断标准"。

在离线奖励判别基准上拿到 86.7% 准确率、86.6 F1,比基线均值 F1 高 3.6 个点;在在线强化学习里当奖励信号,让智能体任务成功率净增 4.23 个点,且推理成本反而更低。


  • 论文题目:

    Task-Adaptive Rubrics for GUI Reward Modeling

01

先粗后细的评分表

ADAPT RUBRIC 的核心思路可以概括成一条清晰的流水线:先检索粗准则来锚定任务边界,再生成细准则补充具体约束,最后把两者融合、精选轨迹上下文,交给验证器打分。


1、类别级粗准则检索

粗准则检索解决的是“这一类任务该查什么”。

论文先用一次离线的 LLM 辅助归纳,把类别级准则库建好,之后就固定下来,方便复现和对比。

具体做法是从已有 GUI Agent 基准的开发轨迹池里采样成功和失败样本,让 LLM 总结出能区分成功与失败的验证维度,再把这些维度归并成如下图所示的八个大类。

每个类别对应一个条目,里面包含验证步骤、常见坑点、特殊规则和输出格式。


推理时,新指令先经过任务路由器预测所属类别,再从库里取出对应粗准则;如果认不出专门类别,就退回到通用兜底。

这一步的价值在于给验证器立下清晰的任务族边界,比如通信类要重点看收件人、内容和发送确认,创建/修改类则关注对象是否真正落地。

它解决的是跨任务时“统一查什么”的框架问题。

2、实例级细准则生成

细准则生成则补上粗准则看不到的细节。

粗准则只知道“这一类任务查什么”,但当前指令里的具体数值、范围、约束它仍然不清楚。

同样是通信任务,“把 Mike 的安全公告同步到 Mastodon、保持原文、仅粉丝可见、并打上 @openCompany 标签”,这些都是只属于这条指令的细粒度要求。

于是第二级让一个 Rubric 生成器根据指令、类别和粗准则,产出最多两条实例级细准则。它不会去重写粗准则 ,只补“当前指令独有且必须检查”的额外项。

论文给生成器加了三条硬约束:

  • Instruction Grounding(指令扎根)

每一条细准则都必须能在用户指令里找到明确的短语、数值或约束作支撑,杜绝模型自己加戏。

  • Compactness(紧凑)

最多2条,只高亮最有用的实例级要求,避免又退化成一份冗长 checklist。

  • Abstention(可弃权)

当当前指令确实不需要额外细项时,直接返回 ,不强行补。

这样粗准则管边界,细准则管这回的确切要求,职责分明,互不干扰。

3、准则融合与奖励验证

最后一步是准则融合与验证。

拿到粗准则和细准则后,把粗准则作为主体,把细准则作为独立的任务专属块追加在后面;如果细准则弃权,就只保留粗准则。

验证前还会做一次上下文精选,完整轨迹可能有几十帧,全部喂进去既贵又容易让模型看花眼,所以只保留不超过设定数量的高信号帧:初始帧、终止帧,以及文本输入、提交、状态切换等关键动作附近的帧。

最后把精选上下文、用户指令和融合后的准则一起交给 VLM 验证器,输出 0 或 1 的成功判断。

这个设计对工程特别友好,它只改了喂给验证器的“判分标准”和“轨迹上下文”,验证器本身的架构完全不动。

也就是说,换任何 VLM 当 judge 都能直接套用,这一点在后续跨 backbone 的实验里得到了反复验证。

02

性能评估

论文在离线判别和在线训练两个场景里做了验证。

1、离线判别

在 OGRBench 上(1409 条跨 Ubuntu / 安卓 / Windows / macOS / Web 的轨迹),ADAPT RUBRIC 的准确率和 F1 分别是 86.7% 和 86.6;

在同等「最多看 10 张截图」的条件下,比两个对照方法的平均 F1 高 3.6 个点。提升主要来自召回,能认出更多「其实成功了」的轨迹,同时没有把误判率拉高。


2、在线训练

用这套判分器给强化学习(GRPO)当奖励信号,训练 MAI-UI-8B,任务成功率从 19.70% 提到 23.93%(+4.23 个点),是几个对照奖励方案里最高的。

说明它打的分不只是离线判别更准,拿来训模型也更有用。


3、测试时筛选

同一道题采样多条候选轨迹、用判分器挑最好的那条,ADAPT RUBRIC 比随机挑选在 EarlyStop 和 Best-of-N 两种策略下分别多 11.88 和 13.28 个点,而且把失败轨迹误判为成功的比例仍压得很低(11.17%)。


消融实验也印证了「粗」和「细」是互补的,去掉细评分表,F1 掉 2.0;去掉粗评分表,同样掉 2.0;两个都不要、只靠截图硬看,直接掉 5.9。


另外在成本上,它用的模型调用和 token 比几个对照方法更省,质量还更好。

03

总结

这套方法也有没覆盖到的地方。论文自己提到两点:

评测虽覆盖了手机、桌面和网页,但没穷尽所有应用、界面和指令风格;

评分银行是离线建好、评测期间固定的,胜在可复现、好对比,但可能跟不上新冒出来的应用或领域特定的流程。

把判分标准从一套通用模板或模型自由发挥,变成类别边界 + 指令要点的组合,是这篇工作最主要的想法。

它没换判分模型,而是在出题这一步下功夫,把题出对,往往比把分打细更影响结果。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
心理学:凡是在吃的方面特别舍得、不算计、不计较的人,你就大胆的跟他相处,这样的人大概率人品差不了

心理学:凡是在吃的方面特别舍得、不算计、不计较的人,你就大胆的跟他相处,这样的人大概率人品差不了

心理观察局
2026-08-14 06:34:03
这很科学:89%的人幻想过同时和多人发生性行为,算精神出轨吗?

这很科学:89%的人幻想过同时和多人发生性行为,算精神出轨吗?

宇宙时空
2026-05-26 18:20:10
波士顿动力IPO计划遇阻:Atlas人形机器人尚未大规模部署

波士顿动力IPO计划遇阻:Atlas人形机器人尚未大规模部署

IT之家
2026-09-14 17:35:06
《交锋》反转!被3个男人毁掉的傻女孩,最后亲手送顶级内鬼入狱

《交锋》反转!被3个男人毁掉的傻女孩,最后亲手送顶级内鬼入狱

野路乐熊
2026-09-14 20:47:12
多家意媒:丹尼尔·马尔蒂尼涉嫌酒驾+毒驾

多家意媒:丹尼尔·马尔蒂尼涉嫌酒驾+毒驾

体坛周报
2026-09-14 15:35:13
医生发现:能吃能喝的老人,基本在63岁,就已经不做这6件事了!

医生发现:能吃能喝的老人,基本在63岁,就已经不做这6件事了!

任医生聊健康
2026-09-08 19:55:07
浙江富豪陈天桥:我给美国捐70亿不假,但中国科学缺钱和我没关系

浙江富豪陈天桥:我给美国捐70亿不假,但中国科学缺钱和我没关系

五元讲堂
2024-10-15 14:48:49
1735年,雍正帝驾崩,李卫哭晕在棺椁前。乾隆看明白了他的心思,先恩赏,后升官,等他一死又下令:拆了他的生祠

1735年,雍正帝驾崩,李卫哭晕在棺椁前。乾隆看明白了他的心思,先恩赏,后升官,等他一死又下令:拆了他的生祠

沐书闲读
2026-09-10 16:40:10
越挖越深!古柯再抖刘晓庆猛料,庆奶回应,两人私密事仅冰山一角

越挖越深!古柯再抖刘晓庆猛料,庆奶回应,两人私密事仅冰山一角

北海史记
2026-08-13 18:36:27
太离谱!铁头蹲8年,涉事企业高调庆功,王海反手撕碎伪装!

太离谱!铁头蹲8年,涉事企业高调庆功,王海反手撕碎伪装!

再战五百回合
2026-09-14 18:58:38
甘肃省政府党组:坚决拥护党中央决定

甘肃省政府党组:坚决拥护党中央决定

新京报
2026-09-14 16:00:15
没签对赌协议,阿里12亿投资恒大足球为何能全身而退?

没签对赌协议,阿里12亿投资恒大足球为何能全身而退?

暗香暗香
2026-09-14 00:51:01
巴萨新赛季最薄弱位置出炉,不是中锋和中后卫,却让亚马尔很头疼

巴萨新赛季最薄弱位置出炉,不是中锋和中后卫,却让亚马尔很头疼

大卫的篮球故事
2026-09-14 16:43:25
不要把这个世界,让给那些草台班子

不要把这个世界,让给那些草台班子

黑噪音
2026-09-10 19:37:06
人间绝色刘诗诗:美若天仙,国色天香。沉鱼落雁,倾国倾城!

人间绝色刘诗诗:美若天仙,国色天香。沉鱼落雁,倾国倾城!

十为先生
2026-08-22 17:08:38
你无意中看过哪些不该看的东西?网友:明显是三故意留下的

你无意中看过哪些不该看的东西?网友:明显是三故意留下的

解读热点事件
2026-08-08 00:05:22
女篮世界杯收官:世界第2领先14分被大逆转惨败,美国夺冠五连霸

女篮世界杯收官:世界第2领先14分被大逆转惨败,美国夺冠五连霸

求球不落谛
2026-09-14 04:34:22
英国媒体确认了:被特朗普支持脱离英国后,英国威尔士、苏格兰和北爱尔兰三地首次同时由“希望脱离英国”的首席大臣主政,并在卡迪夫会晤

英国媒体确认了:被特朗普支持脱离英国后,英国威尔士、苏格兰和北爱尔兰三地首次同时由“希望脱离英国”的首席大臣主政,并在卡迪夫会晤

吉刻新闻
2026-09-14 16:31:55
本-华莱士:如果2003年我们选了安东尼 那就无法夺冠

本-华莱士:如果2003年我们选了安东尼 那就无法夺冠

北青网-北京青年报
2026-09-14 20:13:04
曾是东方卫视王牌主持,嫁入豪门早已真相大白,如今落魄到无人知

曾是东方卫视王牌主持,嫁入豪门早已真相大白,如今落魄到无人知

星星没有你亮
2026-09-15 00:02:15
2026-09-15 00:51:00
智猩猩
智猩猩
AI 技术内容与服务平台
112文章数 5关注度
往期回顾 全部

科技要闻

时隔近9年,特斯拉新款Roadster拟十一发布

头条要闻

17岁女孩成"挂壁青年":初中毕业放弃升学 父母已断供

头条要闻

17岁女孩成"挂壁青年":初中毕业放弃升学 父母已断供

体育要闻

兹维列夫,从三十年0冠到一百天2冠

娱乐要闻

敬一丹采访视频曝光,原来早有预兆

财经要闻

东莞证券原副总裁主动投案

汽车要闻

纯电续航960km/迪迪虾上车 腾势N8L纯电售29.98万元起

态度原创

时尚
教育
手机
数码
军事航空

过度防晒,正在掏空女性的骨头

教育要闻

“才大一就会作秀了!”女生每天哭着录视频,网友:做你室友真惨

手机要闻

荣耀Magic9系列大曝光:超能版确认11000mAh电池,Pro Max也来了!

数码要闻

宏碁推出彩色电子纸显示器EP130K 60Hz刷新率打破传统局限

军事要闻

24小时内58次空袭 也门冲突快速升级

无障碍浏览 进入关怀版