网易首页 > 网易号 > 正文 申请入驻

33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形

0
分享至





  • 论文标题:ClawBench:Can AI Agents Complete Everyday Online Tasks?
  • GitHub: https://github.com/TIGER-AI-Lab/ClawBench
  • 项目主页: https://claw-bench.com/
  • 论文链接: https://arxiv.org/abs/2604.08523
  • Hugging Face: https://huggingface.co/collections/TIGER-Lab/clawbench

如果你觉得 AI agent 离帮你订机票、填报销单、投简历只有一步之遥,那 MMLU-Pro 的作者联合滑铁卢大学 TIGER Lab,UBC NAIL Group 和 UniPat AI,CMU 等机构刚刚放出的这项研究,可能会让你冷静下来。

ClawBench,一个让 AI agent 在144 个真实生产环境网站上执行日常任务的新评估框架,结果堪称惨烈:



最强的 Claude Sonnet 4.6,每三个任务就要翻车两个。GPT-5.4 更是只有 6.5%—— 在 153 个任务中仅完成 10 个。 而且,153 个任务里有 68 个(44.4%)没有任何一个模型能做对。一个都没有。

不是 "AI 会不会用浏览器" 的问题,

是 "AI 能不能替你干活" 的问题

现有的网页 agent 评测,大多长这样:

  • WebArena:在自己搭的沙箱里测,网站是假的,页面是静态的,能出什么错?
  • OSWorld:虚拟机里跑,就 9 个应用,翻来覆去测那几招。
  • Mind2Web:更省事,直接拿录好的操作轨迹考选择题 —— 连浏览器都不用开。

前沿模型在这些评测上能轻松拿到 65%-75% 的分数,看上去让 agent 执行现实任务指日可待。

但 ClawBench 干了一件不一样的事:它让 AI 用浏览器直接接入真实网页。不是沙箱,不是模拟器,是人们每天都在用的那些生产环境 ——Google Flights、DoorDash、Zillow、Instacart、Airbnb、LinkedIn、Doodle……144 个平台,153 个任务,覆盖了从购物、订票、投简历到填保险报价单等 15 个日常类别。



而且 AI 要解决的不是 "搜一下某个航班多少钱" 这种只读任务。ClawBench 考的是写操作 —— 下单、预约、提交申请、发送消息。换句话说,它考察的是 AI 能否作为用户的 “替身”,完成真正需要通过交互改变和理解网站状态的复杂任务。

结果是:那些沙箱里的高分,在真实网站上几乎清零了。

论文的原话一针见血:

"Strong performance on existing web-agent benchmarks does not transfer to everyday write-heavy tasks on live production websites."

翻译过来就是:你以为的学霸,换了个考场直接交白卷。

安全难题:怎么让 AI 随便点,

又不让它真把钱花出去?

这个基准有一个绕不开的技术难题:你让 AI 在真实网站上执行写操作,它万一真下了个订单、真投了份简历、真发了一封邮件 —— 谁来背锅?

ClawBench 的解决方案很巧妙,叫做final-request interception(终态请求拦截)。

具体做法是:人类标注员先把每个任务完整走一遍,标记出那个 "不可逆的最后一击" 是哪个 HTTP 请求 —— 比如 DoorDash 上的 "下单" 按钮对应的 POST 请求。然后,在 AI agent 执行任务时,系统通过 Chrome 扩展和 CDP(Chrome DevTools Protocol)监控所有出站流量。论文报告了一个让人放心的数字:在 153 个人类参考运行中,拦截器 100% 捕获了所有终端请求,零误伤导航流量。



换句话说,AI 可以像人类用户那样正常浏览、搜索、填表、点击,在真实网站上走完全程,— 但当它试图发出那个标记好的终端请求时,系统直接拦截,请求永远到不了服务器。 AI 可以在网站上 "走完全程",但影响真实世界的扳机永远不会真的扣下去。

不是 "不够聪明",

而是 "最后一公里" 集体恐惧症

论文最有意思的发现,藏在失败轨迹的细粒度分析里。

表面上看,Claude Sonnet 4.6 的失败是因为人工验证墙拦截(Cloudflare、DataDome 验证码直接拒掉自动浏览器)、登录卡关、填错表单字段这些 "硬伤"。



但有一个问题在所有模型身上反复出现,论文称之为 "last-mile non-commitment"—— 最后一公里恐惧症。

什么意思?Agent 能把前面的步骤全做对:找到正确的网站、搜到正确的商品、点进正确的页面、填好正确的表单…… 然后,在需要点那个 "提交"/"确认"/"下单" 按钮的时候,它停住了。

论文里有一个让人哭笑不得的案例:

ClawBench 任务 780:在韩国美妆网站 Soko Glam 上完成一次购买流程。Claude Sonnet 4.6 完美地找到了商品、添加到购物车、进入结算页面、开始填收货地址 —— 然后在输入街道地址打到一半的时候,轨迹戛然而止。没有点击 "提交订单",没有发出任何提交请求。171 秒,121 个浏览器操作,全部正确 —— 只差最后一步。

论文统计显示,八个模型中有六个,大量失败轨迹都堆积在 "已到达最终确认页面但未提交" 这个阶段。



另一个让人意外的发现是:失败轨迹消耗的浏览器操作数量,比成功轨迹还要多。Claude Sonnet 4.6 的失败运行中位操作数是 120 次,而成功运行只需 64 次。Gemini 3 Flash 的失败中位数是 74 次,成功是 45 次。



这说明什么?AI 不是探索不够,而是在原地打转。碰到验证码就反复刷新、遇到表单校验不通过就重复填、被反爬墙拦住就不停重试 —— 大量的 token 和 API 费用,烧在了毫无进展的死循环里。

GPT-5.4 怎么了?14 个工具调用就交卷

这张成绩单上,最让人意外的不是谁赢了,而是谁崩了。





GPT-5.4,OpenAI 的旗舰模型,在 ClawBench 上只拿了6.5%。153 个任务完成 10 个。

但比这个数字更离谱的是它的行为模式:

  • 平均每个任务只做 13 次工具调用(Qwen 3.5 是 42 次,Sonnet 4.6 是 61 次)。
  • 85 个任务上直接主动退出(agent_exited),是自己说 "我完事了" 然后走人。
  • 中位运行时长只有196 秒,而 Sonnet 4.6 的中位数是 593 秒。

论文的诊断是 "early termination"—— 不是能力不够,是根本没认真做。GPT-5.4 似乎倾向于 "快速判断任务太复杂然后放弃",而不是像 Sonnet 4.6 那样坚持到要么成功要么撞墙。

而在它真正尝试的任务里,又暴露出另一种问题 ——"假完成"(false completion):

ClawBench 任务 2:在 DoorDash 上点一个 Big Mac 和一份 20 块麦乐鸡。GPT-5.4 搜到了麦当劳、点了 Big Mac、加了购物车 —— 然后 Agent 自己宣布 "Both items are correct",认为任务完成。但实际上,订单根本没提交,购物车里只有它自己以为的两样东西。

换句话说,GPT-5.4 不仅不爱干活,干的时候还经常干错了自己还不知道。

Qwen 3.5:开源模型的体面

在一片愁云惨雾中,Qwen 3.5 是唯一值得多看两眼的亮色。

26.1% 的完成率(排名第二),每个任务的 API 成本只有$1.02—— 是 Sonnet 4.6 的七分之一。每个成功百分点消耗的 token 是所有模型里最低的,平均每次任务只做 42 次工具调用,是 "最能打的高效选手"。

更难得的是 Qwen 3.5 展现出的执行纪律。论文中有一个典型案例:任务要求在一个叫 Insurify 的保险报价网站上填写一份超长的多页表单。这个任务有大约 40 个连续的屏幕页面,涉及级联依赖字段(比如邮编错了后面的选项会变)。Qwen 3.5 以 "单调的快照 - 操作循环" 一页一页地推进,遇到两次字段依赖陷阱(加拿大邮编被拒 → 切换到美国邮编;日期控件输入格式不对 → 自动切换输入方式),都自行恢复了,最终完成提交。

同一任务,GPT-5.40 次操作直接退出,Gemini 3.1 Flash Lite9 次操作后闲置超时。

当然,26.1% 离 "能用" 还差得远。但它说明一件事:在真实世界的 agent 任务上,开源模型靠执行纪律 —— 而非模型尺寸,已经可以和闭源旗舰站在同一个量级竞争。

GLM-5:最省钱的玩家

智谱的 GLM-5 是另一个值得关注的数据点。

24.2% 的完成率,综合排名第三,但每个任务的 API 成本仅$0.64—— 不到 Sonnet 4.6 的十分之一。在成本 - 性能坐标系上,GLM-5 是最接近原点的那一个。

不过 GLM-5 有一个明显的短板:48.4% 的任务因超时(30 分钟时限)而终止,是八个模型中最高的。这说明它能打,但打得慢:在需要长程规划和持续行动的任务上,时间不够用。

谁在什么任务上称王?

答案是:没有人能通吃

上面详细解读了结果中重要信息,然而 ClawBench 按场景拆分的成绩单,揭示了另一个有趣的发现:不同模型擅长的领域完全不同,没有一个模型能做到面面俱到。

  • Shopping(购物):Sonnet 4.6 以 62% 碾压全场。
  • Social(社交):Sonnet 4.6 拿下 75%。
  • Work(工作):GLM-5 以 38.1% 登顶,Sonnet 排第三。
  • Dev & Tech(开发技术):Haiku 4.5 和 Gemini 3 Flash 并列第一,只有 27.8%—— 但也比 Sonnet 的 11.1% 好出一倍多。
  • Travel(旅行):Qwen 3.5 和 Gemini 3 Flash 并列第一,Sonnet 只排第四。
  • Job Search(找工作):全军覆没,最好的 Haiku 4.5 也只有 12.5%,Sonnet 0%。
  • Automation(自动化):Sonnet0%。 这种 "东边亮了西边灭" 的格局说明:当前的网页 agent 不是一种通用能力,而是一堆参差不齐的领域特化表现的拼凑。一个在购物网站上大杀四方的模型,可能在求职网站上连第一步都走不动。





人类 vs AI:

同样的浏览器,完全不同的玩法

ClawBench 还记录了一个数据维度,在其他 benchmark 里几乎从没被认真对待过:交互动力学。 论文对比了人类和 AI agent 在同一套 Chromium 浏览器里的操作特征,差距大到像是两个物种:



人类打字是逐键按下,AI agent 是整段文本瞬间灌注(type 动作)。人类有鼠标轨迹,AI 直接做像素级点击跳转。这种 "不像人" 的行为特征,恰恰是很多反爬系统一眼识别出 bot 的原因。

论文的潜台词很明确:AI agent 在真实网站上失败,不只是因为 "不够聪明",也因为 "动作太不像人"—— 而这恰恰是那些沙箱 benchmark 永远不会暴露的问题。

Anti-bot:AI agent 面前最硬的墙

在所有失败原因中,出现频率最高的不是一个技术难题,而是一个工程现实:反爬虫系统。

Cloudflare Turnstile、PerimeterX、DataDome…… 这些网站用来识别和阻挡机器流量的系统,成了 AI agent 面前最坚固的马奇诺防线。

论文中有一个典型案例:

GLM-5 被要求去 Zillow 上搜索多伦多市中心的一居室公寓并提交租房申请。它打开 Zillow,迎面撞上 PerimeterX 的 "按住以确认你是人类" 对话框。接下来的 33 个 turn 里,它尝试了点击拖拽、DOM 探测、甚至注入合成触摸事件 —— 都失败了。最后,它放弃 Zillow,自己决定换到另一个网站(viewit.ca),搜索了 "Toronto downtown" 后陷入闲置。任务失败。

最讽刺的是,GLM-5准确地诊断了问题—— 它清楚地描述出 "这是一个 Cloudflare 或类似的 bot 保护页面,验证机制专门设计来检测和阻止自动化交互"。但知道问题是什么,和能解决问题之间,隔着一条它跨不过去的鸿沟。

这种事在 ClawBench 上反复发生:AI 能识别出 "我刚才被验证码挡住了",但就是过不去。和人类比起来,这些模型在真实互联网的 "入场资格" 上就输了一截。

ClawBench 和 ProgramBench:

两条路,一个结论

如果你觉得这个标题似曾相识,没错,2026 年 5 月,我们曾经报道过 SWE-Bench 原班人马发布的ProgramBench:让 AI 从零重建 FFmpeg、SQLite、ripgrep 等真实软件项目,结果 Claude、GPT、Gemini 全部 0% 完成率。

ClawBench 和 ProgramBench,一横一纵,指向了同一个结论:

ProgramBench 考的是 "AI 能不能当软件工程师":从零设计和实现一个系统。答案是:不能。

ClawBench 考的是 "AI 能不能当你的私人助理":替你在真实网站上完成一件日常琐事。答案是:基本不能。

两者加起来,画出了一条清晰的战线:AI 在受控环境下的代码生成和网页导航已经很强了,但一旦面对真实世界的复杂性 —— 需要长期规划、多步执行、应对意外、理解上下文 —— 当前的模型距离 "可用" 还有巨大的鸿沟。

这不是一个 "再加一年数据和算力就能解决" 的问题。ProgramBench 暴露的是系统级架构能力的缺失,ClawBench 暴露的是真实环境交互鲁棒性的缺失 —— 这两个问题,都不是靠简单地 "再大一点、再多训一点" 就能自然解决的。

所以,我们离 "AI 替我干活" 还有多远?

ClawBench 的 33.3% 天花板,翻译成日常语言大概是这样: 你让 AI 帮你在三个网站上各做一件事,它能完整做对其中一件。剩下两件,要么半途而废,要么被验证码挡在门外,要么填了表但不敢点提交,要么自己宣布 "搞定了" 但实际上什么都没发生,要么干脆直接退出。

但换个角度看,三件事能做对一件,在三年前是一个笑话,在今天是 33.3%。

ClawBench 真正的价值,不在于给 agent 的能力打出一个低分,而在于第一次系统性地测量了 "AI 从实验室走到真实互联网" 这一跃的距离有多远。论文里的五层轨迹记录、Agent-as-Judge 协议、final-request 拦截机制,构成了一个可以反复测量这个距离的标尺。 下次当有模型在 ClawBench 上拿到 50%、70%、甚至 90% 的时候 —— 那才是真正值得激动的时刻。

作者简介

张宇轩,英属哥伦比亚大学博士生 (个人主页: https://yuxuan.world/),主要研究方向为Agentic AI,Reinforcement Learning,Auto Research, Recursive Self-Improvement,LLMs,相关成果发表于ICLR,COLM,EMNLP等国际会议。

王钰博,滑铁卢大学博士生 (个人主页:https://wyyyb.github.io/),MMLU-Pro一作,主要研究方向为Behavior of LLMs, multimodal reasoning, evaluation,相关成果发表于NeurIPS,ICLR,COLM,EMNLP,ACL等国际会议。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
央行行长潘功胜,最新发声

央行行长潘功胜,最新发声

证券时报
2026-09-02 19:26:05
中一签或赚超28万!国产GPU四小龙之一,今日申购

中一签或赚超28万!国产GPU四小龙之一,今日申购

21世纪经济报道
2026-09-02 07:50:40
全红婵近照变化太大了,熬过了最难的发育关,小姑娘彻底长开了,模样跟以前判若两人

全红婵近照变化太大了,熬过了最难的发育关,小姑娘彻底长开了,模样跟以前判若两人

In风尚
2026-08-22 06:04:58
马斯克:穷人之所以穷,只有一个原因——没看透人与人之间利益交换的本质

马斯克:穷人之所以穷,只有一个原因——没看透人与人之间利益交换的本质

杏花烟雨江南的碧园
2026-08-20 11:15:03
莱万:皇马有新援和穆帅加入后感觉更强了,但我始终支持巴萨

莱万:皇马有新援和穆帅加入后感觉更强了,但我始终支持巴萨

懂球帝
2026-09-02 18:28:09
吴石案终极潜伏者隐姓 42 年,晚年返大陆热泪盈眶

吴石案终极潜伏者隐姓 42 年,晚年返大陆热泪盈眶

唠叨说历史
2026-01-07 12:42:21
大开眼界!许家印当年奢靡生活曝光

大开眼界!许家印当年奢靡生活曝光

麦杰逊
2026-08-23 15:09:25
全能天才!阿森纳压哨截胡曼联!完美复刻厄德高 + 斯凯利

全能天才!阿森纳压哨截胡曼联!完美复刻厄德高 + 斯凯利

澜归序
2026-09-02 08:17:16
胡军李乃文“大闹”内娱综艺,今年最好笑的节目

胡军李乃文“大闹”内娱综艺,今年最好笑的节目

娱乐圈十三太保
2026-09-02 16:38:02
深圳将新增一家山姆会员店!

深圳将新增一家山姆会员店!

深圳晚报
2026-09-02 16:31:56
我国每年近千万人做肠镜!医生直言:做一次肠镜,或管十年无碍

我国每年近千万人做肠镜!医生直言:做一次肠镜,或管十年无碍

芹姐说生活
2026-08-26 23:55:43
有本事多重要?20万天价富豪饭局,张雪一分没花,一句话道破玄机

有本事多重要?20万天价富豪饭局,张雪一分没花,一句话道破玄机

秋姐居
2026-09-02 10:04:25
“半月工资仅55元,被踢出845个工作群”,官方回应:用人单位已全额支付判决确定的费用,针对该员工新提出的社保相关诉求,将会同有关部门进行核处

“半月工资仅55元,被踢出845个工作群”,官方回应:用人单位已全额支付判决确定的费用,针对该员工新提出的社保相关诉求,将会同有关部门进行核处

每日经济新闻
2026-09-01 19:34:59
燃气公司上门安检,根本不是查漏气!真正目的其实是这三件事

燃气公司上门安检,根本不是查漏气!真正目的其实是这三件事

阿离家居
2026-08-31 03:09:49
半年亏21亿,智谱开网店卖token

半年亏21亿,智谱开网店卖token

观察者网
2026-09-02 15:30:40
什么情况?范子铭首发登场30分钟10中1 手感不佳连续秀中投惹争议

什么情况?范子铭首发登场30分钟10中1 手感不佳连续秀中投惹争议

狼叔评论
2026-09-02 20:12:03
媒体人:国家不欠刘翔的!他自己非要留在体制内 享受最顶级待遇

媒体人:国家不欠刘翔的!他自己非要留在体制内 享受最顶级待遇

念洲
2026-08-30 09:09:35
iPhone Ultra 要发布了!直接提前看

iPhone Ultra 要发布了!直接提前看

花果科技
2026-09-02 13:54:13
一个巴西球员,在中国赚了9.4亿:钱从哪来的,最后谁买单

一个巴西球员,在中国赚了9.4亿:钱从哪来的,最后谁买单

生活新鲜市
2026-08-23 05:24:19
76岁大爷每天暴走2万步,退休金8000,最后死在睡梦中

76岁大爷每天暴走2万步,退休金8000,最后死在睡梦中

小鹿姐姐情感说
2026-09-01 11:37:45
2026-09-02 20:56:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13905文章数 142728关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

10万级的满配B级车 试驾2027款比亚迪海豹06

态度原创

游戏
本地
亲子
房产
公开课

《FF7》蒂法惨遭DLSS5摧残!变大妈难以接受

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

亲子要闻

宝蓝和弟弟妹妹手上涂满颜料,用手掌画画,有趣又漂亮~

房产要闻

新四代住宅 新样板间开放丨以艺术之名 赴一场迭代之约

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版