网易首页 > 网易号 > 正文 申请入驻

33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形

0
分享至





  • 论文标题:ClawBench:Can AI Agents Complete Everyday Online Tasks?
  • GitHub: https://github.com/TIGER-AI-Lab/ClawBench
  • 项目主页: https://claw-bench.com/
  • 论文链接: https://arxiv.org/abs/2604.08523
  • Hugging Face: https://huggingface.co/collections/TIGER-Lab/clawbench

如果你觉得 AI agent 离帮你订机票、填报销单、投简历只有一步之遥,那 MMLU-Pro 的作者联合滑铁卢大学 TIGER Lab,UBC NAIL Group 和 UniPat AI,CMU 等机构刚刚放出的这项研究,可能会让你冷静下来。

ClawBench,一个让 AI agent 在144 个真实生产环境网站上执行日常任务的新评估框架,结果堪称惨烈:



最强的 Claude Sonnet 4.6,每三个任务就要翻车两个。GPT-5.4 更是只有 6.5%—— 在 153 个任务中仅完成 10 个。 而且,153 个任务里有 68 个(44.4%)没有任何一个模型能做对。一个都没有。

不是 "AI 会不会用浏览器" 的问题,

是 "AI 能不能替你干活" 的问题

现有的网页 agent 评测,大多长这样:

  • WebArena:在自己搭的沙箱里测,网站是假的,页面是静态的,能出什么错?
  • OSWorld:虚拟机里跑,就 9 个应用,翻来覆去测那几招。
  • Mind2Web:更省事,直接拿录好的操作轨迹考选择题 —— 连浏览器都不用开。

前沿模型在这些评测上能轻松拿到 65%-75% 的分数,看上去让 agent 执行现实任务指日可待。

但 ClawBench 干了一件不一样的事:它让 AI 用浏览器直接接入真实网页。不是沙箱,不是模拟器,是人们每天都在用的那些生产环境 ——Google Flights、DoorDash、Zillow、Instacart、Airbnb、LinkedIn、Doodle……144 个平台,153 个任务,覆盖了从购物、订票、投简历到填保险报价单等 15 个日常类别。



而且 AI 要解决的不是 "搜一下某个航班多少钱" 这种只读任务。ClawBench 考的是写操作 —— 下单、预约、提交申请、发送消息。换句话说,它考察的是 AI 能否作为用户的 “替身”,完成真正需要通过交互改变和理解网站状态的复杂任务。

结果是:那些沙箱里的高分,在真实网站上几乎清零了。

论文的原话一针见血:

"Strong performance on existing web-agent benchmarks does not transfer to everyday write-heavy tasks on live production websites."

翻译过来就是:你以为的学霸,换了个考场直接交白卷。

安全难题:怎么让 AI 随便点,

又不让它真把钱花出去?

这个基准有一个绕不开的技术难题:你让 AI 在真实网站上执行写操作,它万一真下了个订单、真投了份简历、真发了一封邮件 —— 谁来背锅?

ClawBench 的解决方案很巧妙,叫做final-request interception(终态请求拦截)。

具体做法是:人类标注员先把每个任务完整走一遍,标记出那个 "不可逆的最后一击" 是哪个 HTTP 请求 —— 比如 DoorDash 上的 "下单" 按钮对应的 POST 请求。然后,在 AI agent 执行任务时,系统通过 Chrome 扩展和 CDP(Chrome DevTools Protocol)监控所有出站流量。论文报告了一个让人放心的数字:在 153 个人类参考运行中,拦截器 100% 捕获了所有终端请求,零误伤导航流量。



换句话说,AI 可以像人类用户那样正常浏览、搜索、填表、点击,在真实网站上走完全程,— 但当它试图发出那个标记好的终端请求时,系统直接拦截,请求永远到不了服务器。 AI 可以在网站上 "走完全程",但影响真实世界的扳机永远不会真的扣下去。

不是 "不够聪明",

而是 "最后一公里" 集体恐惧症

论文最有意思的发现,藏在失败轨迹的细粒度分析里。

表面上看,Claude Sonnet 4.6 的失败是因为人工验证墙拦截(Cloudflare、DataDome 验证码直接拒掉自动浏览器)、登录卡关、填错表单字段这些 "硬伤"。



但有一个问题在所有模型身上反复出现,论文称之为 "last-mile non-commitment"—— 最后一公里恐惧症。

什么意思?Agent 能把前面的步骤全做对:找到正确的网站、搜到正确的商品、点进正确的页面、填好正确的表单…… 然后,在需要点那个 "提交"/"确认"/"下单" 按钮的时候,它停住了。

论文里有一个让人哭笑不得的案例:

ClawBench 任务 780:在韩国美妆网站 Soko Glam 上完成一次购买流程。Claude Sonnet 4.6 完美地找到了商品、添加到购物车、进入结算页面、开始填收货地址 —— 然后在输入街道地址打到一半的时候,轨迹戛然而止。没有点击 "提交订单",没有发出任何提交请求。171 秒,121 个浏览器操作,全部正确 —— 只差最后一步。

论文统计显示,八个模型中有六个,大量失败轨迹都堆积在 "已到达最终确认页面但未提交" 这个阶段。



另一个让人意外的发现是:失败轨迹消耗的浏览器操作数量,比成功轨迹还要多。Claude Sonnet 4.6 的失败运行中位操作数是 120 次,而成功运行只需 64 次。Gemini 3 Flash 的失败中位数是 74 次,成功是 45 次。



这说明什么?AI 不是探索不够,而是在原地打转。碰到验证码就反复刷新、遇到表单校验不通过就重复填、被反爬墙拦住就不停重试 —— 大量的 token 和 API 费用,烧在了毫无进展的死循环里。

GPT-5.4 怎么了?14 个工具调用就交卷

这张成绩单上,最让人意外的不是谁赢了,而是谁崩了。





GPT-5.4,OpenAI 的旗舰模型,在 ClawBench 上只拿了6.5%。153 个任务完成 10 个。

但比这个数字更离谱的是它的行为模式:

  • 平均每个任务只做 13 次工具调用(Qwen 3.5 是 42 次,Sonnet 4.6 是 61 次)。
  • 85 个任务上直接主动退出(agent_exited),是自己说 "我完事了" 然后走人。
  • 中位运行时长只有196 秒,而 Sonnet 4.6 的中位数是 593 秒。

论文的诊断是 "early termination"—— 不是能力不够,是根本没认真做。GPT-5.4 似乎倾向于 "快速判断任务太复杂然后放弃",而不是像 Sonnet 4.6 那样坚持到要么成功要么撞墙。

而在它真正尝试的任务里,又暴露出另一种问题 ——"假完成"(false completion):

ClawBench 任务 2:在 DoorDash 上点一个 Big Mac 和一份 20 块麦乐鸡。GPT-5.4 搜到了麦当劳、点了 Big Mac、加了购物车 —— 然后 Agent 自己宣布 "Both items are correct",认为任务完成。但实际上,订单根本没提交,购物车里只有它自己以为的两样东西。

换句话说,GPT-5.4 不仅不爱干活,干的时候还经常干错了自己还不知道。

Qwen 3.5:开源模型的体面

在一片愁云惨雾中,Qwen 3.5 是唯一值得多看两眼的亮色。

26.1% 的完成率(排名第二),每个任务的 API 成本只有$1.02—— 是 Sonnet 4.6 的七分之一。每个成功百分点消耗的 token 是所有模型里最低的,平均每次任务只做 42 次工具调用,是 "最能打的高效选手"。

更难得的是 Qwen 3.5 展现出的执行纪律。论文中有一个典型案例:任务要求在一个叫 Insurify 的保险报价网站上填写一份超长的多页表单。这个任务有大约 40 个连续的屏幕页面,涉及级联依赖字段(比如邮编错了后面的选项会变)。Qwen 3.5 以 "单调的快照 - 操作循环" 一页一页地推进,遇到两次字段依赖陷阱(加拿大邮编被拒 → 切换到美国邮编;日期控件输入格式不对 → 自动切换输入方式),都自行恢复了,最终完成提交。

同一任务,GPT-5.40 次操作直接退出,Gemini 3.1 Flash Lite9 次操作后闲置超时。

当然,26.1% 离 "能用" 还差得远。但它说明一件事:在真实世界的 agent 任务上,开源模型靠执行纪律 —— 而非模型尺寸,已经可以和闭源旗舰站在同一个量级竞争。

GLM-5:最省钱的玩家

智谱的 GLM-5 是另一个值得关注的数据点。

24.2% 的完成率,综合排名第三,但每个任务的 API 成本仅$0.64—— 不到 Sonnet 4.6 的十分之一。在成本 - 性能坐标系上,GLM-5 是最接近原点的那一个。

不过 GLM-5 有一个明显的短板:48.4% 的任务因超时(30 分钟时限)而终止,是八个模型中最高的。这说明它能打,但打得慢:在需要长程规划和持续行动的任务上,时间不够用。

谁在什么任务上称王?

答案是:没有人能通吃

上面详细解读了结果中重要信息,然而 ClawBench 按场景拆分的成绩单,揭示了另一个有趣的发现:不同模型擅长的领域完全不同,没有一个模型能做到面面俱到。

  • Shopping(购物):Sonnet 4.6 以 62% 碾压全场。
  • Social(社交):Sonnet 4.6 拿下 75%。
  • Work(工作):GLM-5 以 38.1% 登顶,Sonnet 排第三。
  • Dev & Tech(开发技术):Haiku 4.5 和 Gemini 3 Flash 并列第一,只有 27.8%—— 但也比 Sonnet 的 11.1% 好出一倍多。
  • Travel(旅行):Qwen 3.5 和 Gemini 3 Flash 并列第一,Sonnet 只排第四。
  • Job Search(找工作):全军覆没,最好的 Haiku 4.5 也只有 12.5%,Sonnet 0%。
  • Automation(自动化):Sonnet0%。 这种 "东边亮了西边灭" 的格局说明:当前的网页 agent 不是一种通用能力,而是一堆参差不齐的领域特化表现的拼凑。一个在购物网站上大杀四方的模型,可能在求职网站上连第一步都走不动。





人类 vs AI:

同样的浏览器,完全不同的玩法

ClawBench 还记录了一个数据维度,在其他 benchmark 里几乎从没被认真对待过:交互动力学。 论文对比了人类和 AI agent 在同一套 Chromium 浏览器里的操作特征,差距大到像是两个物种:



人类打字是逐键按下,AI agent 是整段文本瞬间灌注(type 动作)。人类有鼠标轨迹,AI 直接做像素级点击跳转。这种 "不像人" 的行为特征,恰恰是很多反爬系统一眼识别出 bot 的原因。

论文的潜台词很明确:AI agent 在真实网站上失败,不只是因为 "不够聪明",也因为 "动作太不像人"—— 而这恰恰是那些沙箱 benchmark 永远不会暴露的问题。

Anti-bot:AI agent 面前最硬的墙

在所有失败原因中,出现频率最高的不是一个技术难题,而是一个工程现实:反爬虫系统。

Cloudflare Turnstile、PerimeterX、DataDome…… 这些网站用来识别和阻挡机器流量的系统,成了 AI agent 面前最坚固的马奇诺防线。

论文中有一个典型案例:

GLM-5 被要求去 Zillow 上搜索多伦多市中心的一居室公寓并提交租房申请。它打开 Zillow,迎面撞上 PerimeterX 的 "按住以确认你是人类" 对话框。接下来的 33 个 turn 里,它尝试了点击拖拽、DOM 探测、甚至注入合成触摸事件 —— 都失败了。最后,它放弃 Zillow,自己决定换到另一个网站(viewit.ca),搜索了 "Toronto downtown" 后陷入闲置。任务失败。

最讽刺的是,GLM-5准确地诊断了问题—— 它清楚地描述出 "这是一个 Cloudflare 或类似的 bot 保护页面,验证机制专门设计来检测和阻止自动化交互"。但知道问题是什么,和能解决问题之间,隔着一条它跨不过去的鸿沟。

这种事在 ClawBench 上反复发生:AI 能识别出 "我刚才被验证码挡住了",但就是过不去。和人类比起来,这些模型在真实互联网的 "入场资格" 上就输了一截。

ClawBench 和 ProgramBench:

两条路,一个结论

如果你觉得这个标题似曾相识,没错,2026 年 5 月,我们曾经报道过 SWE-Bench 原班人马发布的ProgramBench:让 AI 从零重建 FFmpeg、SQLite、ripgrep 等真实软件项目,结果 Claude、GPT、Gemini 全部 0% 完成率。

ClawBench 和 ProgramBench,一横一纵,指向了同一个结论:

ProgramBench 考的是 "AI 能不能当软件工程师":从零设计和实现一个系统。答案是:不能。

ClawBench 考的是 "AI 能不能当你的私人助理":替你在真实网站上完成一件日常琐事。答案是:基本不能。

两者加起来,画出了一条清晰的战线:AI 在受控环境下的代码生成和网页导航已经很强了,但一旦面对真实世界的复杂性 —— 需要长期规划、多步执行、应对意外、理解上下文 —— 当前的模型距离 "可用" 还有巨大的鸿沟。

这不是一个 "再加一年数据和算力就能解决" 的问题。ProgramBench 暴露的是系统级架构能力的缺失,ClawBench 暴露的是真实环境交互鲁棒性的缺失 —— 这两个问题,都不是靠简单地 "再大一点、再多训一点" 就能自然解决的。

所以,我们离 "AI 替我干活" 还有多远?

ClawBench 的 33.3% 天花板,翻译成日常语言大概是这样: 你让 AI 帮你在三个网站上各做一件事,它能完整做对其中一件。剩下两件,要么半途而废,要么被验证码挡在门外,要么填了表但不敢点提交,要么自己宣布 "搞定了" 但实际上什么都没发生,要么干脆直接退出。

但换个角度看,三件事能做对一件,在三年前是一个笑话,在今天是 33.3%。

ClawBench 真正的价值,不在于给 agent 的能力打出一个低分,而在于第一次系统性地测量了 "AI 从实验室走到真实互联网" 这一跃的距离有多远。论文里的五层轨迹记录、Agent-as-Judge 协议、final-request 拦截机制,构成了一个可以反复测量这个距离的标尺。 下次当有模型在 ClawBench 上拿到 50%、70%、甚至 90% 的时候 —— 那才是真正值得激动的时刻。

作者简介

张宇轩,英属哥伦比亚大学博士生 (个人主页: https://yuxuan.world/),主要研究方向为Agentic AI,Reinforcement Learning,Auto Research, Recursive Self-Improvement,LLMs,相关成果发表于ICLR,COLM,EMNLP等国际会议。

王钰博,滑铁卢大学博士生 (个人主页:https://wyyyb.github.io/),MMLU-Pro一作,主要研究方向为Behavior of LLMs, multimodal reasoning, evaluation,相关成果发表于NeurIPS,ICLR,COLM,EMNLP,ACL等国际会议。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“没有手艺都是科技”,青岛一烤羊店招牌被六旬师傅装反,店主:主打纯手艺无科技,视频太火了,正在犹豫要不要改过来

“没有手艺都是科技”,青岛一烤羊店招牌被六旬师傅装反,店主:主打纯手艺无科技,视频太火了,正在犹豫要不要改过来

扬子晚报
2026-09-01 12:22:59
不查不知道一查吓一跳!执掌恒大27年的许家印,私下到底有多壕?

不查不知道一查吓一跳!执掌恒大27年的许家印,私下到底有多壕?

花颜蕴韵
2026-09-02 17:32:24
紧急预警!新型入室盗窃席卷全国,无数家庭已经中招

紧急预警!新型入室盗窃席卷全国,无数家庭已经中招

小虎新车推荐员
2026-09-01 09:17:01
体坛大乱!国羽高层被一锅端,刘国梁被带走?唯独蔡振华全身而退

体坛大乱!国羽高层被一锅端,刘国梁被带走?唯独蔡振华全身而退

林子说事
2026-09-02 12:21:47
外卖下半场,为何最先恢复的是美团?

外卖下半场,为何最先恢复的是美团?

道总有理
2026-09-01 20:53:59
日媒得出大胆结论:特朗普仅用6个月,就把美国霸权逼至终结拐点

日媒得出大胆结论:特朗普仅用6个月,就把美国霸权逼至终结拐点

福建睿平
2026-09-02 07:21:31
423万拆迁款女儿一分没有,父亲大寿她不去,一月后哥哥送来文件

423万拆迁款女儿一分没有,父亲大寿她不去,一月后哥哥送来文件

林林故事揭秘
2025-05-06 15:43:19
赛力斯8月销量骤降44%:问界品牌近乎腰斩

赛力斯8月销量骤降44%:问界品牌近乎腰斩

阿芒娱乐说
2026-09-02 05:09:21
品牌打印机为什么不愿适配鸿蒙系统?

品牌打印机为什么不愿适配鸿蒙系统?

小柱解说游戏
2026-08-31 13:21:35
麦克托米奈:若皇马来电,我会考虑

麦克托米奈:若皇马来电,我会考虑

懂球帝
2026-09-02 16:00:41
韩国光州双年展恢复“台湾馆”名称,大陆艺术家集体撤展,国台办:台湾参与国际活动,必须按照一个中国原则来处理

韩国光州双年展恢复“台湾馆”名称,大陆艺术家集体撤展,国台办:台湾参与国际活动,必须按照一个中国原则来处理

政知新媒体
2026-09-02 13:03:33
吴柳芳谈退役安置不公:我没刘翔那命,只有16万买断

吴柳芳谈退役安置不公:我没刘翔那命,只有16万买断

东方不败然多多
2026-09-01 11:00:29
卡塔尔半岛电视台确认了:美国偷袭伊朗拉腊克岛,美军轰炸了岛上两处伊朗革命卫队火箭发射装置,这是美军一个月来首次对伊朗采取军事行动

卡塔尔半岛电视台确认了:美国偷袭伊朗拉腊克岛,美军轰炸了岛上两处伊朗革命卫队火箭发射装置,这是美军一个月来首次对伊朗采取军事行动

吉刻新闻
2026-08-31 07:20:45
“一个月陪睡一两次”:网红魏莹的榜一大哥照片曝光,他身价过亿,是个大企业家

“一个月陪睡一两次”:网红魏莹的榜一大哥照片曝光,他身价过亿,是个大企业家

江山挥笔
2026-08-25 16:40:36
孙宇晨前女友曾颖回应景甜“三千万彩礼”:他给的大概率是千万要开心,千万要幸福,千万要平安

孙宇晨前女友曾颖回应景甜“三千万彩礼”:他给的大概率是千万要开心,千万要幸福,千万要平安

背包旅行
2026-08-31 17:43:35
金正恩女儿持枪开坦克,韩情报院称已进入接班人内定阶段

金正恩女儿持枪开坦克,韩情报院称已进入接班人内定阶段

桂系007
2026-09-02 10:15:38
常州400多人HR群事件发酵!成都网友爆料,当地同样存在这类HR同盟群,直言“钱可以让人不要脸,更不要心”

常州400多人HR群事件发酵!成都网友爆料,当地同样存在这类HR同盟群,直言“钱可以让人不要脸,更不要心”

火山詩话
2026-08-31 08:17:34
消化科主任忠告:立即停止食用这5类素食,吃的越多,息肉越大

消化科主任忠告:立即停止食用这5类素食,吃的越多,息肉越大

医学科普汇
2026-09-02 15:50:59
高铁女孩熟睡男生盯死手机不敢转头,两百万外网围观无声的人机对峙,藏着成年人不敢破冰的社交尴尬防线

高铁女孩熟睡男生盯死手机不敢转头,两百万外网围观无声的人机对峙,藏着成年人不敢破冰的社交尴尬防线

明话直说
2026-08-25 18:07:55
离婚的妇人都是咋和前夫相处的?网友:我就好奇,有没有睡在一起

离婚的妇人都是咋和前夫相处的?网友:我就好奇,有没有睡在一起

带你感受人间冷暖
2026-08-31 00:05:16
2026-09-02 18:15:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13904文章数 142728关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

尼泊尔用无人机找幸存者 隧道被泥浆"像牙膏一样"塞满

头条要闻

尼泊尔用无人机找幸存者 隧道被泥浆"像牙膏一样"塞满

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

需要重视的全球“资金失衡”

汽车要闻

23万级给到激光雷达和900km续航 比亚迪海狮08售22.99万起

态度原创

手机
时尚
本地
游戏
数码

手机要闻

华为详解nova 16 Pro内部空间设计,7.1mm机身塞7000mAh电池

夏天别总穿黑色裤子,试试这几款高腰裙,显瘦优雅又提气质

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

《巫师3》杀穿科隆!新DLC愿望单碾压科隆所有展出游戏

数码要闻

万元显卡售后翻车!用户收到变形RTX 5080不敢修:装不进机箱没法用

无障碍浏览 进入关怀版