网易首页 > 网易号 > 正文 申请入驻

GUI Agent奖励模型总判错,浙大联合小米用一套自适应评分表解决了!

0
分享至

智猩猩AI整理

编辑:金水

这两年 GUI Agent 很火,训好它们或筛优质轨迹都离不开结果奖励模型(ORM),给执行轨迹打 0/1,判断是否成功。

但现有 GUI 奖励验证器经常判错,问题出在构建成功标准的两种方式,其一静态模板稳定但太通用,只问“任务完成没”,不关心具体对象、数值、范围和格式;其二隐式推理灵活但无清晰边界,常漏关键细节或自己加戏、过度严苛。

核心矛盾是验证器打分前根本没拿到一条贴合当前任务的判断标准。

针对这个"标准不够任务自适应(task-adaptive)"的缺陷,浙江大学联合小米(MiLM Plus)提出 ADAPT RUBRIC——一个粗到细(Coarse-to-Fine)的 Rubric 框架,专门解决"怎么从一条用户指令里,生成贴合它的判断标准"。

在离线奖励判别基准上拿到 86.7% 准确率、86.6 F1,比基线均值 F1 高 3.6 个点;在在线强化学习里当奖励信号,让智能体任务成功率净增 4.23 个点,且推理成本反而更低。


  • 论文题目:

    Task-Adaptive Rubrics for GUI Reward Modeling

01

先粗后细的评分表

ADAPT RUBRIC 的核心思路可以概括成一条清晰的流水线:先检索粗准则来锚定任务边界,再生成细准则补充具体约束,最后把两者融合、精选轨迹上下文,交给验证器打分。


1、类别级粗准则检索

粗准则检索解决的是“这一类任务该查什么”。

论文先用一次离线的 LLM 辅助归纳,把类别级准则库建好,之后就固定下来,方便复现和对比。

具体做法是从已有 GUI Agent 基准的开发轨迹池里采样成功和失败样本,让 LLM 总结出能区分成功与失败的验证维度,再把这些维度归并成如下图所示的八个大类。

每个类别对应一个条目,里面包含验证步骤、常见坑点、特殊规则和输出格式。


推理时,新指令先经过任务路由器预测所属类别,再从库里取出对应粗准则;如果认不出专门类别,就退回到通用兜底。

这一步的价值在于给验证器立下清晰的任务族边界,比如通信类要重点看收件人、内容和发送确认,创建/修改类则关注对象是否真正落地。

它解决的是跨任务时“统一查什么”的框架问题。

2、实例级细准则生成

细准则生成则补上粗准则看不到的细节。

粗准则只知道“这一类任务查什么”,但当前指令里的具体数值、范围、约束它仍然不清楚。

同样是通信任务,“把 Mike 的安全公告同步到 Mastodon、保持原文、仅粉丝可见、并打上 @openCompany 标签”,这些都是只属于这条指令的细粒度要求。

于是第二级让一个 Rubric 生成器根据指令、类别和粗准则,产出最多两条实例级细准则。它不会去重写粗准则 ,只补“当前指令独有且必须检查”的额外项。

论文给生成器加了三条硬约束:

  • Instruction Grounding(指令扎根)

每一条细准则都必须能在用户指令里找到明确的短语、数值或约束作支撑,杜绝模型自己加戏。

  • Compactness(紧凑)

最多2条,只高亮最有用的实例级要求,避免又退化成一份冗长 checklist。

  • Abstention(可弃权)

当当前指令确实不需要额外细项时,直接返回 ,不强行补。

这样粗准则管边界,细准则管这回的确切要求,职责分明,互不干扰。

3、准则融合与奖励验证

最后一步是准则融合与验证。

拿到粗准则和细准则后,把粗准则作为主体,把细准则作为独立的任务专属块追加在后面;如果细准则弃权,就只保留粗准则。

验证前还会做一次上下文精选,完整轨迹可能有几十帧,全部喂进去既贵又容易让模型看花眼,所以只保留不超过设定数量的高信号帧:初始帧、终止帧,以及文本输入、提交、状态切换等关键动作附近的帧。

最后把精选上下文、用户指令和融合后的准则一起交给 VLM 验证器,输出 0 或 1 的成功判断。

这个设计对工程特别友好,它只改了喂给验证器的“判分标准”和“轨迹上下文”,验证器本身的架构完全不动。

也就是说,换任何 VLM 当 judge 都能直接套用,这一点在后续跨 backbone 的实验里得到了反复验证。

02

性能评估

论文在离线判别和在线训练两个场景里做了验证。

1、离线判别

在 OGRBench 上(1409 条跨 Ubuntu / 安卓 / Windows / macOS / Web 的轨迹),ADAPT RUBRIC 的准确率和 F1 分别是 86.7% 和 86.6;

在同等「最多看 10 张截图」的条件下,比两个对照方法的平均 F1 高 3.6 个点。提升主要来自召回,能认出更多「其实成功了」的轨迹,同时没有把误判率拉高。


2、在线训练

用这套判分器给强化学习(GRPO)当奖励信号,训练 MAI-UI-8B,任务成功率从 19.70% 提到 23.93%(+4.23 个点),是几个对照奖励方案里最高的。

说明它打的分不只是离线判别更准,拿来训模型也更有用。


3、测试时筛选

同一道题采样多条候选轨迹、用判分器挑最好的那条,ADAPT RUBRIC 比随机挑选在 EarlyStop 和 Best-of-N 两种策略下分别多 11.88 和 13.28 个点,而且把失败轨迹误判为成功的比例仍压得很低(11.17%)。


消融实验也印证了「粗」和「细」是互补的,去掉细评分表,F1 掉 2.0;去掉粗评分表,同样掉 2.0;两个都不要、只靠截图硬看,直接掉 5.9。


另外在成本上,它用的模型调用和 token 比几个对照方法更省,质量还更好。

03

总结

这套方法也有没覆盖到的地方。论文自己提到两点:

评测虽覆盖了手机、桌面和网页,但没穷尽所有应用、界面和指令风格;

评分银行是离线建好、评测期间固定的,胜在可复现、好对比,但可能跟不上新冒出来的应用或领域特定的流程。

把判分标准从一套通用模板或模型自由发挥,变成类别边界 + 指令要点的组合,是这篇工作最主要的想法。

它没换判分模型,而是在出题这一步下功夫,把题出对,往往比把分打细更影响结果。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
时隔近九年,新款特斯拉跑车Roadster拟10月1日发布

时隔近九年,新款特斯拉跑车Roadster拟10月1日发布

界面新闻
2026-09-14 15:28:42
老外吃过中国国宴、印度国宴,一褒一沉默,印餐到底是什么水平?

老外吃过中国国宴、印度国宴,一褒一沉默,印餐到底是什么水平?

李博世财经
2026-09-14 10:28:06
谢霆锋19岁长子大排档吃宵夜,生图太像爸爸了!眉眼帅气一目了然

谢霆锋19岁长子大排档吃宵夜,生图太像爸爸了!眉眼帅气一目了然

空樽对月花独瘦
2026-09-13 04:13:27
经组织严格考核选拔,烈士肖思远的弟弟肖荣基提干了

经组织严格考核选拔,烈士肖思远的弟弟肖荣基提干了

新京报政事儿
2026-09-14 10:14:23
苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

川渝视觉
2026-04-17 22:13:14
王楚钦再创历史,将成第一个把世界第一拱手送给日本的国乒运动员

王楚钦再创历史,将成第一个把世界第一拱手送给日本的国乒运动员

人类的关注
2026-09-06 04:32:21
正式出征!U23国足名单更新,两人退出,“武磊接班人”入选,目标=小组出线

正式出征!U23国足名单更新,两人退出,“武磊接班人”入选,目标=小组出线

小秦哥聊体育
2026-09-14 18:30:01
钱堆成山,也挽不回敬一丹那口气

钱堆成山,也挽不回敬一丹那口气

布衣乱弹
2026-09-13 20:08:57
王健林已经惨到什么程度了?

王健林已经惨到什么程度了?

叶葉夜
2026-08-11 23:30:32
29岁中国女留学生诬告英警强奸致对方被拘35小时,最终被判6年

29岁中国女留学生诬告英警强奸致对方被拘35小时,最终被判6年

雪峰说法
2026-09-14 11:05:03
罗永浩吐槽野人先生冰淇淋“难吃”,网友齐刷“不要回答”,不回应是上策吗?品牌该如何应对名人差评?

罗永浩吐槽野人先生冰淇淋“难吃”,网友齐刷“不要回答”,不回应是上策吗?品牌该如何应对名人差评?

之乎者也小鱼儿
2026-09-14 09:47:35
德国选举上演荒诞剧,44%选票赢不来执政权,输家联合执政引争议

德国选举上演荒诞剧,44%选票赢不来执政权,输家联合执政引争议

呼呼历史论
2026-09-14 08:09:19
不会演特务别硬演!《潜伏》李涯18年后,祖峰和余皑磊谁演得更坏

不会演特务别硬演!《潜伏》李涯18年后,祖峰和余皑磊谁演得更坏

头号电影院
2026-09-13 22:24:53
万亿资产归零,全国第四大保险集团破产,1.5万亿保单怎么样了?

万亿资产归零,全国第四大保险集团破产,1.5万亿保单怎么样了?

米果说识
2026-08-17 19:17:49
火锅店门口一男子持刀伤人,广州警方:犯罪嫌疑人已被抓获

火锅店门口一男子持刀伤人,广州警方:犯罪嫌疑人已被抓获

新京报
2026-09-14 20:12:15
彻底摊牌了?一个欠9亿一个骗13.9亿,董卿被爆猛料,原来她和王丽坤同样困境

彻底摊牌了?一个欠9亿一个骗13.9亿,董卿被爆猛料,原来她和王丽坤同样困境

她时尚丫
2026-08-07 18:55:34
在部队系统和消防,政委是党委书记;但在公安,政委是党委副书记

在部队系统和消防,政委是党委书记;但在公安,政委是党委副书记

小圣杂谈原创
2026-09-14 16:32:11
浙江商K都关门属不实传言:存在有偿陪侍的不允许营业,确实有不少“公主”要回家嫁人了

浙江商K都关门属不实传言:存在有偿陪侍的不允许营业,确实有不少“公主”要回家嫁人了

汉史趣闻
2026-09-14 10:34:45
野人先生被罗永浩吐槽难吃,网友建议“管好老板”“不要回复”,其抖音账号13日单日涨粉近3万

野人先生被罗永浩吐槽难吃,网友建议“管好老板”“不要回复”,其抖音账号13日单日涨粉近3万

齐鲁壹点
2026-09-14 16:39:18
“逼着孩子猛吸致癌物”,家长带娃去地下停车场上自习,被嘲戏精附体

“逼着孩子猛吸致癌物”,家长带娃去地下停车场上自习,被嘲戏精附体

妍妍教育日记
2026-09-14 19:50:15
2026-09-14 23:52:49
智猩猩
智猩猩
AI 技术内容与服务平台
112文章数 5关注度
往期回顾 全部

科技要闻

时隔近9年,特斯拉新款Roadster拟十一发布

头条要闻

17岁女孩成"挂壁青年":初中毕业放弃升学 父母已断供

头条要闻

17岁女孩成"挂壁青年":初中毕业放弃升学 父母已断供

体育要闻

兹维列夫,从三十年0冠到一百天2冠

娱乐要闻

敬一丹采访视频曝光,原来早有预兆

财经要闻

东莞证券原副总裁主动投案

汽车要闻

纯电续航960km/迪迪虾上车 腾势N8L纯电售29.98万元起

态度原创

本地
旅游
艺术
时尚
公开课

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

旅游要闻

阿拉伯旅游展聚焦创新与科技

艺术要闻

砸31亿!赛力斯把Logo盖成大楼,最新实景图曝光!

平时别只会“黑白配”,用各种彩色搭配白色,高级亮眼又耐看

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版