网易首页 > 网易号 > 正文 申请入驻

大模型能干,懂模帝会飞

0
分享至


模型用浏览器哪家强

AI圈最新的趋势是唯模型论,这方面的具体表现有两个:

半年前以前还是模型是水电煤,同质化竞争,最后都没有利润,智谱、MiniMax上市是在砸盘。现在争着抢着问智谱新模型啥时候发(智谱自己也有意无意在对外放新模型的料),恨不得立即冲进去炒一波;

一批类似马卡龙这种的幽默AI应用转型成Neo Lab,搞个后训练狂蹭智谱,另一批转型成若干定语的世界模型公司,什么因果世界模型、社交世界模型,感觉世界要末日了。

AI应用跪得都太快了,反而忽略了自己的唯一价值:场景。

模型公司是不懂场景的,他们朝着Coding拼命卷,结果写作能力越来越退步、话也说不利索,搞得现在我看豆包说话都有点眉清目秀了。

所以模型都是纸老虎,看着强但用不到真场景里。

所以模型优化是需要更多真实场景的评测,而这恰恰是应用公司擅长的。

于是葬AI和我们的朋友钟经纬、正阳一起做了款产品:懂模帝

懂模帝的主要目的是收录应用公司在自己场景上对各类模型的评测。

目前已经收纳了评估游戏开发能力的Gamecraft Bench、测试训模型能力的RSI Bench、让Agent运营一家AI Saas公司的CEO Bench、以及测试模型使用浏览器能力的 Ego Bench等多样评测集。

打开 fuckai.md 即可浏览,从名字就能看出我们对模型的态度:


懂模帝的目的是,让评测集大众化,帮助更多能找到更多元、更符合自己业务场景的评测集,去评估自己应该用什么模型,再到未来用什么Agent、Skill和工具。

只要人人都会后训练,人人皆为懂模帝。那世界不会被模型公司统治,应用公司也不会完蛋!

我们第一期评测的主题是,模型用浏览器到底哪家强?

本期bench和Aute合作。简单介绍下,Aute在做一款叫 ego (lite) 的浏览器,专为人类用户和 Agent 共同使用而设计。

这个产品本质上是在把整个互联网变成模型友好的API,然后你就可以带上自己的 Codex、Pi 甚至 是WorkBuddy来调用它。

从抓取需要登录的网站信息到操控云厂商那复杂无比的后台页面,都能给你办了。于是我一度建议他贴身 WorkBuddy 猛猛炒作。

至于现在的产品为啥叫 lite。他给我看过还未发布的完整版 ego,云端持久在线 Agent + 浏览器 + 各个端的本地控制能力 + 云盘 + 输入法,缝完了属于是。

但这和我们今天的 bench 关系不大,我们回到 bench 上。

整套 bench 总共有 31 道题,绝对数量不多,但都尽量在贴近真实场景并使用真实网站。

包括统计 Hacker News 的热门帖、 筛选 IMDb 科幻电影、申请 OpenAI 的职位、去 Reddit 找工作、填写从纽约到迈阿密的单程航班表单、通过查询就业人数和年均工资比较两个地区谁更适合零售门店扩张等等。

除了整体的结果判定,每道题都设有关键步骤的得分小点,我们选了十六个模型进行跑分,

直接放评测结果:

S级:GPT-5.6、Claude Fable 5、Claude Opus 5

A级:Qwen 3.8 Max Preview、Doubao Seed Evolving、DeepSeek V4 Flash

B级:GLM-5.2、Kimi K3、Hunyuan Hy3

C级:MiniMax M3、DeepSeek V4 Pro、Step 3.7 Flash

D级:LongCat2.0

E级:文心一言 5.1、MiMo V2.5 Pro


表现最好的三个没啥好说的,都是公认最牛逼的。

国模这块,严格来算第一是DeepSeek V4 Flash,在接近一样表现的情况下,只花了几块钱,是所有模型中花费最低的。

对比下来效果还不如DeepSeek的GLM-5.2花了170块。

第二梯队是GLM-5.2、Kimi K3、Hunyuan Hy3,他们和第一梯队的主要差距在于任务效果波动很大。

多说一句,时至今日在跑 Kimi K3 时,我们总能遇到中断、速度极慢、API不稳定的问题,有8个任务都被提前结束了,我们为此重跑了一遍,但 K3 最后的表现依然一般,

目之所及,算力资源和卡还是最重要的事情,我看这英伟达还能涨。

说表现得烂的,文心一言 5.1 就不说了,经典稳定发挥,填进来属于一个纯乐子的作用。

但小米大模型竟然比文心一言还菜我是没想到的。

第一遍跑的时候大部分任务报错我觉得可能是运气问题,于是重跑了 24 个任务。

结果还是有 23 个提前结束,小米MiMo V2.5 Pro 总是声明自己要下一步做某些事情,但就是不调用 tools,然后会话结束。。。难道小米大模型专注在上车了?

我问Aute为何会如此,Aute说,「模型能不能积极地完成长程任务,会不会在某一轮提前结束,这本身就是模型能力的体现。」

「之前有用户来吐槽我们东西不好用,我们一看他电脑,他在用 Mimo。」

雷总直接告他别告我谢谢

接着我们来分析各个模型在部分题目中的表现,以下解读也得到了朋友钟经纬的帮助。

第一题直接面对现实,让我们 cos 成美国人,跟模型说在 Yelp(美国大众点评)找一家芝加哥评价好、价格适中的意大利餐厅,日期要选择芝加哥当地时间所对应的「下一个日历周」的星期六,找到后还要在网站上完成预定。

这题感觉天生给美团小美设计的,先看看龙猫表现如何:


结果很可惜,LongCat2.0搜了个名字就歇菜了。这波属于是跟美国大众点评没配合好,水土不服了。

同样一步未成的还有,MiMo V2.5 Pro、Step 3.7 Flash、文心一言5.1和Kimi K3。

国模里Tencent HY3、Doubao Seed Evolving、DeepSeek V4 Pro都完成了预约。

说明这些模型很通人性,建议美团小美可以接他们来用。

第二题是回顾 OpenAI 过去一周的社交媒体表现,了解哪些帖子获得了最多关注和互动,要求排除置顶帖、纯转发,以及标有“Replying to @”的帖子,按浏览量从高到低列出前五条,并为每条提供发布日期、浏览量、回复数、点赞数和互动率,最后计算平均浏览量和平均互动率。

这个任务比较简单,模型或多或少都能给个结果。

国模里完成最好的是Tencent HY3、Qwen 3.8 Max Preview和Doubao Seed Evolving,都完成了任务。

差的模型如GLM-5.2,抓取和排序都做好了,但没有排除Replying to @的帖子,污染了样本;Long Cat 2.0则是一个帖子也没提取出来。

文心一言打开X后,去搜了 2025 年 5 月的帖子,只能说文心一言确实活在去年;

小米更过分,登了账号,滑了两下就一动不动了,直接开摆;

K3也是滚一会就不动了。


小米滑了几下就不动了

第三题,让各家模型去亚马逊找到一款不锈钢水杯,通过顾客评论找到这款水杯在什么情况下会漏水,要求产品至少有 1,000 条顾客评分,最后需要总结出最频发的漏水情况。

这道题有两个难点,第一是模型会不会评论搜索,第二要理解评论在说什么,并且选出一条差评。

这个任务里表现最好的是Fable5与Qwen3.8max,圆满完成任务。

剩下大部分模型都能搜索到水杯,但输在没法筛选出真实差评上。

比如K3一直在找 Amazon 的评论搜索框,但一条差评也没搜到:


GLM5.2找到了评论区,但一直在翻 Amazon 的 AI 总结,没把具体顾客的差评找出来。

和它表现一样是Doubao Seed Evolving。AI模型爱看AI总结情有可原。

最差的还是小米,搜索完水杯后就一动不动了,死活不去看评论:


以上都是 bench 内的正经题,我们再整些神题来测测。

首先,测试一个模型能通过几关《小鳄鱼爱洗澡》,有没有人懂这个游戏含金量的。

这些逼模型天天说自己要解决世纪数学难题,要是连《小鳄鱼爱洗澡》都过不去可就有意思了。

prompt:按页面说明用鼠标拖动挖开泥土,把水引到小鳄鱼的浴缸。每次通关后选择「下一关」,在任务时间内持续闯关,尽最大努力完成尽可能多的关卡。小鸭是额外收集目标,但优先保证过关。

GPT 5.6打到了第四关,收集了7只鸭子,是模型里最能玩《小鳄鱼爱洗澡》的。


K3、Step 3.7 Flash、Claude Opus 5都卡在开始游戏的界面不动弹,不懂是不是不爱玩游戏。


剩下大部分模型都没多模态输入能力都卡在游戏打开界面。

这也看得出来,我们国产模型都不太爱打游戏,东亚模型就是这样认真好学

哦对,之前 ego lite 团队还用 GPT 5.6 玩《梦幻西游》大半天,刷到了 54级。

这下我真得喊话《梦幻西游》的反外挂团队了。《梦幻西游》团队看到的话得算我找到了BUG,记得打钱。


第二个任务是要求每家模型去画奶龙,注意,是要在浏览器内的数字画板上,用鼠标移动画笔一笔一笔地手绘,而不是生成那种各家早已定向优化的画 SVG。

注意,是画奶龙不是画陈冕,为了防止模型理解错,我们还给了参考图。


这下肯定不会画成冕神了

经过一番激烈争夺后,我决定把奶龙王颁给Claude Opus 5.0,它用精确的操控能力证明,劣质画板也能画出好图:


反观豆包画的:


这是否印证了一鸣说过的Seed不蒸馏,因为这个操控画板能力他们从没训练过。

还有几个模型给我交了白卷或者一通乱画:

但最值得说道的是K3。

集美模型太神了,给我把奶龙画成奶娃了。是不是前端美术能力训练过头了,我看这模型快整成美颜相机了。


最后是五子棋锦标赛,一共有16只模型参赛,两两对战,胜者晋级。

第一轮就被淘汰的是,文心一言 5.1、MiMo V2.5 Pro、MiniMax M3、Step 3.7 Flash、LongCat2.0、Doubao Seed Evolving、Hunyuan Hy3、Claude Fable 5。

看得出来,除了Claude Fable 5倒霉的碰上Claude Opus 5.0被干掉后,其他模型的水平实力大伙都是有目共睹的。

决赛是由Claude Opus 5对战Qwen 3.8 Max Preview,Qwen只下了13 手就败下来。

这活本来是想考验模型的棋商,结果一大堆模型都因为3分钟一棋不下直接判负,属于是棋盘都操控不明白。

一圈看下来,结合成本和各个任务的完成度,国模里DeepSeek V4 Flash还是太超模了,梁圣斩杀线的含金量还在上升;

第二梯队如K3,简单任务都能完成,但遇到复杂操作老是提前停,集美模型喜欢知难而退;

第三梯队就是MiMo V2.5 Pro这种,总是声称「下一步要做什么」后就结束,规划是规划明白了,动是真不动。

所以家人们,浏览器相关的任务以后不在乎钱建议用GPT和Claude、在乎就用DeepSeek V4 Flash,可以避雷小米了——这就是Ego bench唯一想告诉大家的。

过去,模型公司爱刷的榜单都是数学、代码、知识问答这些,大伙都用不太上。而在通用Agent成版本答案的今天,真实使用场景能力的才更需要bench去衡量。

这才是应用公司的价值啊最后call back一下开头:AI应用是不会完蛋的

(本文封面由ChatGPT生成,纯人工写作)

⬇️

欢迎订阅我们的Substack

funeralai.substack.com

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
A股中秋、国庆休市安排公布

A股中秋、国庆休市安排公布

澎湃新闻
2026-09-17 20:00:28
航母有多难养?山东舰上几千人,1天7顿饭,难怪小国养不起航母

航母有多难养?山东舰上几千人,1天7顿饭,难怪小国养不起航母

史之韵
2026-09-17 00:32:58
残酷的现实:普通人存在的意义就是干脏累苦的活,消费,不分蛋糕!

残酷的现实:普通人存在的意义就是干脏累苦的活,消费,不分蛋糕!

黯泉
2026-09-17 11:41:17
最高院:这四类诉讼无时效限制,不管过多久都能起诉!

最高院:这四类诉讼无时效限制,不管过多久都能起诉!

周军律师聊案子
2026-09-16 10:53:31
“罗永浩说野人先生难吃”冲上热搜,店员回应:不知道罗永浩是谁,价格偏贵应该是品牌的定义

“罗永浩说野人先生难吃”冲上热搜,店员回应:不知道罗永浩是谁,价格偏贵应该是品牌的定义

极目新闻
2026-09-15 12:16:02
陈建州心肌梗塞住院 大咖天王暖冲医院「亲拿尿壶」画面曝光

陈建州心肌梗塞住院 大咖天王暖冲医院「亲拿尿壶」画面曝光

ETtoday星光云
2026-09-17 18:19:02
亚运会男篮半决赛对阵:中国男篮vs东道主日本 韩国vs伊朗

亚运会男篮半决赛对阵:中国男篮vs东道主日本 韩国vs伊朗

醉卧浮生
2026-09-16 20:10:19
纪委书记家长请老师"多多关照",通报来了:依规依纪严肃处理

纪委书记家长请老师"多多关照",通报来了:依规依纪严肃处理

文青大叔说
2026-09-17 09:56:21
一场7-2,改写西甲射手榜,巴萨锋霸6轮轰入9球,超越姆巴佩,排名第1

一场7-2,改写西甲射手榜,巴萨锋霸6轮轰入9球,超越姆巴佩,排名第1

足球狗说
2026-09-17 06:21:15
DeepSeek工程师长文爆火出圈,“我不至于会失业,但必须要转业”引发大量共鸣,本人回应:并非表达失业焦虑,是想和过去的时光说句再见

DeepSeek工程师长文爆火出圈,“我不至于会失业,但必须要转业”引发大量共鸣,本人回应:并非表达失业焦虑,是想和过去的时光说句再见

大风新闻
2026-09-16 11:21:19
郁亮,出事了!

郁亮,出事了!

大佬灼见
2026-09-17 09:18:35
你有洗屁股的习惯吗?医生提醒:天天洗肛门的人或能预防4种毛病

你有洗屁股的习惯吗?医生提醒:天天洗肛门的人或能预防4种毛病

芹姐说生活
2026-08-21 22:28:55
伦纳德:这是巴恩斯的球队 我只想赢球不会争权夺位

伦纳德:这是巴恩斯的球队 我只想赢球不会争权夺位

北青网-北京青年报
2026-09-17 19:57:03
高人预测:5年后,持有“燃油车”的家庭,将面对3个现实问题

高人预测:5年后,持有“燃油车”的家庭,将面对3个现实问题

沙雕小琳琳
2026-09-17 11:20:36
德天空:萨内等8名入选了26世界杯阵容的球员落选了本期名单

德天空:萨内等8名入选了26世界杯阵容的球员落选了本期名单

懂球帝
2026-09-17 17:50:28
龙头股三连板!MLCC上游原料供给缺口加大

龙头股三连板!MLCC上游原料供给缺口加大

上海证券报
2026-09-17 13:16:12
台海该慌了!中国正研发目标130公里新炮弹,一旦成真谁最头疼?

台海该慌了!中国正研发目标130公里新炮弹,一旦成真谁最头疼?

掌秋看世界
2026-09-15 18:48:16
广汽丰田,让“遥遥领先”者汗颜

广汽丰田,让“遥遥领先”者汗颜

辣椒车讯
2026-09-17 06:51:29
何音也没想到,前夫黄志忠和柯蓝在一起15年,赢家竟是24岁的儿子

何音也没想到,前夫黄志忠和柯蓝在一起15年,赢家竟是24岁的儿子

阿讯说天下
2026-09-17 14:27:01
长征结束后,周恩来才向毛主席坦白一事,毛怒道:我当面问贺子珍

长征结束后,周恩来才向毛主席坦白一事,毛怒道:我当面问贺子珍

顾秋韵
2026-09-16 13:13:23
2026-09-17 22:27:00
葬AI
葬AI
整点真实
155文章数 28关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

退休副省长家中243万名酒被偷 管家获刑后举报其贪腐

头条要闻

退休副省长家中243万名酒被偷 管家获刑后举报其贪腐

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

猛士X700内饰公布 华为技术加持打造家庭泛越野智能座舱

态度原创

数码
教育
房产
游戏
公开课

数码要闻

999元!小米发布米家空气净化器6C:甲醛去除率99%

教育要闻

新动向!名校毕业生流行回母校当老师

房产要闻

突发!三亚安居房出台新政!

Switch 2一年独占对比PS5五年独占!谁拉跨了?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版