网易首页 > 网易号 > 正文 申请入驻

大模型能干,懂模帝会飞

0
分享至


模型用浏览器哪家强

AI圈最新的趋势是唯模型论,这方面的具体表现有两个:

半年前以前还是模型是水电煤,同质化竞争,最后都没有利润,智谱、MiniMax上市是在砸盘。现在争着抢着问智谱新模型啥时候发(智谱自己也有意无意在对外放新模型的料),恨不得立即冲进去炒一波;

一批类似马卡龙这种的幽默AI应用转型成Neo Lab,搞个后训练狂蹭智谱,另一批转型成若干定语的世界模型公司,什么因果世界模型、社交世界模型,感觉世界要末日了。

AI应用跪得都太快了,反而忽略了自己的唯一价值:场景。

模型公司是不懂场景的,他们朝着Coding拼命卷,结果写作能力越来越退步、话也说不利索,搞得现在我看豆包说话都有点眉清目秀了。

所以模型都是纸老虎,看着强但用不到真场景里。

所以模型优化是需要更多真实场景的评测,而这恰恰是应用公司擅长的。

于是葬AI和我们的朋友钟经纬、正阳一起做了款产品:懂模帝

懂模帝的主要目的是收录应用公司在自己场景上对各类模型的评测。

目前已经收纳了评估游戏开发能力的Gamecraft Bench、测试训模型能力的RSI Bench、让Agent运营一家AI Saas公司的CEO Bench、以及测试模型使用浏览器能力的 Ego Bench等多样评测集。

打开 fuckai.md 即可浏览,从名字就能看出我们对模型的态度:


懂模帝的目的是,让评测集大众化,帮助更多能找到更多元、更符合自己业务场景的评测集,去评估自己应该用什么模型,再到未来用什么Agent、Skill和工具。

只要人人都会后训练,人人皆为懂模帝。那世界不会被模型公司统治,应用公司也不会完蛋!

我们第一期评测的主题是,模型用浏览器到底哪家强?

本期bench和Aute合作。简单介绍下,Aute在做一款叫 ego (lite) 的浏览器,专为人类用户和 Agent 共同使用而设计。

这个产品本质上是在把整个互联网变成模型友好的API,然后你就可以带上自己的 Codex、Pi 甚至 是WorkBuddy来调用它。

从抓取需要登录的网站信息到操控云厂商那复杂无比的后台页面,都能给你办了。于是我一度建议他贴身 WorkBuddy 猛猛炒作。

至于现在的产品为啥叫 lite。他给我看过还未发布的完整版 ego,云端持久在线 Agent + 浏览器 + 各个端的本地控制能力 + 云盘 + 输入法,缝完了属于是。

但这和我们今天的 bench 关系不大,我们回到 bench 上。

整套 bench 总共有 31 道题,绝对数量不多,但都尽量在贴近真实场景并使用真实网站。

包括统计 Hacker News 的热门帖、 筛选 IMDb 科幻电影、申请 OpenAI 的职位、去 Reddit 找工作、填写从纽约到迈阿密的单程航班表单、通过查询就业人数和年均工资比较两个地区谁更适合零售门店扩张等等。

除了整体的结果判定,每道题都设有关键步骤的得分小点,我们选了十六个模型进行跑分,

直接放评测结果:

S级:GPT-5.6、Claude Fable 5、Claude Opus 5

A级:Qwen 3.8 Max Preview、Doubao Seed Evolving、DeepSeek V4 Flash

B级:GLM-5.2、Kimi K3、Hunyuan Hy3

C级:MiniMax M3、DeepSeek V4 Pro、Step 3.7 Flash

D级:LongCat2.0

E级:文心一言 5.1、MiMo V2.5 Pro


表现最好的三个没啥好说的,都是公认最牛逼的。

国模这块,严格来算第一是DeepSeek V4 Flash,在接近一样表现的情况下,只花了几块钱,是所有模型中花费最低的。

对比下来效果还不如DeepSeek的GLM-5.2花了170块。

第二梯队是GLM-5.2、Kimi K3、Hunyuan Hy3,他们和第一梯队的主要差距在于任务效果波动很大。

多说一句,时至今日在跑 Kimi K3 时,我们总能遇到中断、速度极慢、API不稳定的问题,有8个任务都被提前结束了,我们为此重跑了一遍,但 K3 最后的表现依然一般,

目之所及,算力资源和卡还是最重要的事情,我看这英伟达还能涨。

说表现得烂的,文心一言 5.1 就不说了,经典稳定发挥,填进来属于一个纯乐子的作用。

但小米大模型竟然比文心一言还菜我是没想到的。

第一遍跑的时候大部分任务报错我觉得可能是运气问题,于是重跑了 24 个任务。

结果还是有 23 个提前结束,小米MiMo V2.5 Pro 总是声明自己要下一步做某些事情,但就是不调用 tools,然后会话结束。。。难道小米大模型专注在上车了?

我问Aute为何会如此,Aute说,「模型能不能积极地完成长程任务,会不会在某一轮提前结束,这本身就是模型能力的体现。」

「之前有用户来吐槽我们东西不好用,我们一看他电脑,他在用 Mimo。」

雷总直接告他别告我谢谢

接着我们来分析各个模型在部分题目中的表现,以下解读也得到了朋友钟经纬的帮助。

第一题直接面对现实,让我们 cos 成美国人,跟模型说在 Yelp(美国大众点评)找一家芝加哥评价好、价格适中的意大利餐厅,日期要选择芝加哥当地时间所对应的「下一个日历周」的星期六,找到后还要在网站上完成预定。

这题感觉天生给美团小美设计的,先看看龙猫表现如何:


结果很可惜,LongCat2.0搜了个名字就歇菜了。这波属于是跟美国大众点评没配合好,水土不服了。

同样一步未成的还有,MiMo V2.5 Pro、Step 3.7 Flash、文心一言5.1和Kimi K3。

国模里Tencent HY3、Doubao Seed Evolving、DeepSeek V4 Pro都完成了预约。

说明这些模型很通人性,建议美团小美可以接他们来用。

第二题是回顾 OpenAI 过去一周的社交媒体表现,了解哪些帖子获得了最多关注和互动,要求排除置顶帖、纯转发,以及标有“Replying to @”的帖子,按浏览量从高到低列出前五条,并为每条提供发布日期、浏览量、回复数、点赞数和互动率,最后计算平均浏览量和平均互动率。

这个任务比较简单,模型或多或少都能给个结果。

国模里完成最好的是Tencent HY3、Qwen 3.8 Max Preview和Doubao Seed Evolving,都完成了任务。

差的模型如GLM-5.2,抓取和排序都做好了,但没有排除Replying to @的帖子,污染了样本;Long Cat 2.0则是一个帖子也没提取出来。

文心一言打开X后,去搜了 2025 年 5 月的帖子,只能说文心一言确实活在去年;

小米更过分,登了账号,滑了两下就一动不动了,直接开摆;

K3也是滚一会就不动了。


小米滑了几下就不动了

第三题,让各家模型去亚马逊找到一款不锈钢水杯,通过顾客评论找到这款水杯在什么情况下会漏水,要求产品至少有 1,000 条顾客评分,最后需要总结出最频发的漏水情况。

这道题有两个难点,第一是模型会不会评论搜索,第二要理解评论在说什么,并且选出一条差评。

这个任务里表现最好的是Fable5与Qwen3.8max,圆满完成任务。

剩下大部分模型都能搜索到水杯,但输在没法筛选出真实差评上。

比如K3一直在找 Amazon 的评论搜索框,但一条差评也没搜到:


GLM5.2找到了评论区,但一直在翻 Amazon 的 AI 总结,没把具体顾客的差评找出来。

和它表现一样是Doubao Seed Evolving。AI模型爱看AI总结情有可原。

最差的还是小米,搜索完水杯后就一动不动了,死活不去看评论:


以上都是 bench 内的正经题,我们再整些神题来测测。

首先,测试一个模型能通过几关《小鳄鱼爱洗澡》,有没有人懂这个游戏含金量的。

这些逼模型天天说自己要解决世纪数学难题,要是连《小鳄鱼爱洗澡》都过不去可就有意思了。

prompt:按页面说明用鼠标拖动挖开泥土,把水引到小鳄鱼的浴缸。每次通关后选择「下一关」,在任务时间内持续闯关,尽最大努力完成尽可能多的关卡。小鸭是额外收集目标,但优先保证过关。

GPT 5.6打到了第四关,收集了7只鸭子,是模型里最能玩《小鳄鱼爱洗澡》的。


K3、Step 3.7 Flash、Claude Opus 5都卡在开始游戏的界面不动弹,不懂是不是不爱玩游戏。


剩下大部分模型都没多模态输入能力都卡在游戏打开界面。

这也看得出来,我们国产模型都不太爱打游戏,东亚模型就是这样认真好学

哦对,之前 ego lite 团队还用 GPT 5.6 玩《梦幻西游》大半天,刷到了 54级。

这下我真得喊话《梦幻西游》的反外挂团队了。《梦幻西游》团队看到的话得算我找到了BUG,记得打钱。


第二个任务是要求每家模型去画奶龙,注意,是要在浏览器内的数字画板上,用鼠标移动画笔一笔一笔地手绘,而不是生成那种各家早已定向优化的画 SVG。

注意,是画奶龙不是画陈冕,为了防止模型理解错,我们还给了参考图。


这下肯定不会画成冕神了

经过一番激烈争夺后,我决定把奶龙王颁给Claude Opus 5.0,它用精确的操控能力证明,劣质画板也能画出好图:


反观豆包画的:


这是否印证了一鸣说过的Seed不蒸馏,因为这个操控画板能力他们从没训练过。

还有几个模型给我交了白卷或者一通乱画:

但最值得说道的是K3。

集美模型太神了,给我把奶龙画成奶娃了。是不是前端美术能力训练过头了,我看这模型快整成美颜相机了。


最后是五子棋锦标赛,一共有16只模型参赛,两两对战,胜者晋级。

第一轮就被淘汰的是,文心一言 5.1、MiMo V2.5 Pro、MiniMax M3、Step 3.7 Flash、LongCat2.0、Doubao Seed Evolving、Hunyuan Hy3、Claude Fable 5。

看得出来,除了Claude Fable 5倒霉的碰上Claude Opus 5.0被干掉后,其他模型的水平实力大伙都是有目共睹的。

决赛是由Claude Opus 5对战Qwen 3.8 Max Preview,Qwen只下了13 手就败下来。

这活本来是想考验模型的棋商,结果一大堆模型都因为3分钟一棋不下直接判负,属于是棋盘都操控不明白。

一圈看下来,结合成本和各个任务的完成度,国模里DeepSeek V4 Flash还是太超模了,梁圣斩杀线的含金量还在上升;

第二梯队如K3,简单任务都能完成,但遇到复杂操作老是提前停,集美模型喜欢知难而退;

第三梯队就是MiMo V2.5 Pro这种,总是声称「下一步要做什么」后就结束,规划是规划明白了,动是真不动。

所以家人们,浏览器相关的任务以后不在乎钱建议用GPT和Claude、在乎就用DeepSeek V4 Flash,可以避雷小米了——这就是Ego bench唯一想告诉大家的。

过去,模型公司爱刷的榜单都是数学、代码、知识问答这些,大伙都用不太上。而在通用Agent成版本答案的今天,真实使用场景能力的才更需要bench去衡量。

这才是应用公司的价值啊最后call back一下开头:AI应用是不会完蛋的

(本文封面由ChatGPT生成,纯人工写作)

⬇️

欢迎订阅我们的Substack

funeralai.substack.com

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
巨乳完美契合!导演亲荐《生化》电影八尺夫人选角

巨乳完美契合!导演亲荐《生化》电影八尺夫人选角

游民星空
2026-09-16 17:11:35
贺子珍始终认定朱道来便是战乱之中失散的儿子,可朱道来后来坦言:过去他没有道出所有真相

贺子珍始终认定朱道来便是战乱之中失散的儿子,可朱道来后来坦言:过去他没有道出所有真相

唠叨说历史
2026-09-15 14:16:32
汕尾、阳江、茂名发布一批人事任免

汕尾、阳江、茂名发布一批人事任免

南粤女声
2026-09-17 22:32:53
国家一级女演员陈丽云被逮捕!

国家一级女演员陈丽云被逮捕!

许三岁
2026-03-28 09:24:30
纯粹式穿搭,泳衣随性,身形流畅

纯粹式穿搭,泳衣随性,身形流畅

分享情感的梅梅
2026-09-13 07:51:17
原来他俩竟是敬一丹的弟弟!从小被姐姐一手带大,如今已身居高位

原来他俩竟是敬一丹的弟弟!从小被姐姐一手带大,如今已身居高位

米果说识
2026-09-17 11:40:29
直播3小时副乳走光无人管:流量退潮时,体面才是最后的遮羞布

直播3小时副乳走光无人管:流量退潮时,体面才是最后的遮羞布

放开他让wo来
2026-09-16 00:05:28
“山寨村干部”带货,该管管了:写着“村支书”,胸口戴国徽,反复渲染“果子滞销烂在枝头”

“山寨村干部”带货,该管管了:写着“村支书”,胸口戴国徽,反复渲染“果子滞销烂在枝头”

澎湃新闻
2026-09-16 14:57:09
HYROX比赛腹泻这事,运动员拼归拼,但主办方不能装看不见

HYROX比赛腹泻这事,运动员拼归拼,但主办方不能装看不见

果壳
2026-09-16 22:11:08
“一拳打到我父亲头部”,56岁保安遭业主推搡倒地,抢救21天后死亡

“一拳打到我父亲头部”,56岁保安遭业主推搡倒地,抢救21天后死亡

中国新闻周刊
2026-09-17 16:15:44
我问老公,张馨予那么有钱,为什么买一辆15万的车?老公说,不是他们买不起,而是何捷不想让人说闲话。

我问老公,张馨予那么有钱,为什么买一辆15万的车?老公说,不是他们买不起,而是何捷不想让人说闲话。

可读
2026-09-17 22:43:34
“老师”资助孤儿10年 竟是“放长线钓大鱼”间谍!

“老师”资助孤儿10年 竟是“放长线钓大鱼”间谍!

看看新闻Knews
2026-09-17 15:05:12
泽连斯基死定了?他最后的下场,或将跟卡扎菲和萨达姆一样

泽连斯基死定了?他最后的下场,或将跟卡扎菲和萨达姆一样

明天后天大后天
2026-09-17 07:49:24
沙特丢脸丢到全世界了!坐拥数百亿美元军备、牵头十几国联军的沙特,放下身段求以色列帮忙出兵对付胡塞

沙特丢脸丢到全世界了!坐拥数百亿美元军备、牵头十几国联军的沙特,放下身段求以色列帮忙出兵对付胡塞

扶苏聊历史
2026-09-15 17:50:15
宇树科技市值重返2000亿元

宇树科技市值重返2000亿元

财联社
2026-09-17 11:31:03
生男生女取决于父亲?错!多项研究发现:胎儿性别主要取决于母亲!爸爸发牌,妈妈是赛道设计师

生男生女取决于父亲?错!多项研究发现:胎儿性别主要取决于母亲!爸爸发牌,妈妈是赛道设计师

菁妈育儿
2026-09-17 15:54:18
让我用行动证明,我是多么爱你!

让我用行动证明,我是多么爱你!

疾跑的小蜗牛
2026-09-17 20:21:35
一场7-2,改写西甲射手榜,巴萨锋霸6轮轰入9球,超越姆巴佩,排名第1

一场7-2,改写西甲射手榜,巴萨锋霸6轮轰入9球,超越姆巴佩,排名第1

足球狗说
2026-09-17 06:21:15
郑钦文武网正赛递补第7位!直接晋级几无悬念,这些选手大概率退赛

郑钦文武网正赛递补第7位!直接晋级几无悬念,这些选手大概率退赛

一枚野球君
2026-09-17 21:27:03
知情人曝敬一丹病程:挺过18天凶险期,会自主呼吸,差一步能醒

知情人曝敬一丹病程:挺过18天凶险期,会自主呼吸,差一步能醒

夏末moent
2026-09-15 23:56:21
2026-09-18 00:20:49
葬AI
葬AI
整点真实
155文章数 28关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

猛士X700内饰公布 打造家庭泛越野智能座舱

态度原创

旅游
艺术
手机
数码
家居

旅游要闻

香港“国际中秋彩灯汇”亮灯

艺术要闻

海因里希·伯默:德国写实风景画家

手机要闻

ColorOS 17已正式发布:功能特性已清晰,10月8日首批升级,你的机型在列吗?

数码要闻

Bose Ultra Open Earbuds夹耳式无线耳机发布,售价299美元

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版