网易首页 > 网易号 > 正文 申请入驻

Qwen 3.8升级纯血力工模型

0
分享至


下次别做汪峰了

Qwen 3.8 Max是一个很适合干活的模型。

它的编程和Agent能力,稳定地呈现出一流模型水平,仅次于GPT 5.6 Sol和Fable/Opus 5,略微超越K3。所以阿里可以在宣传里强调「编程与办公,全面跃升」。

在葬AI和AI浏览器ego (lite)合作的浏览器专项测试中,Qwen 3.8 Max也是一流水平,仅次于硅谷双子星。这块后文会专门展开。

Qwen 3.8的软肋在多模态和一次性生成能力。最典型的场景是一次性生成漂亮网页和小游戏,这一块Qwen 3.8显著落后K3,后者专门优化了这块能力。

所以,评价Qwen 3.8 Max是一个定位问题。

Qwen 3.8 Max没有在模型产品化上多做一步,导致用户很难靠生成一两个小游戏觉得模型牛逼。它不是一个独立的模型产品,而是一个为集团业务服务,能力相对均衡稳定的基座模型。

让我们来逐项充分检验Qwen 3.8 Max的能力。

首先登场的是ego (lite)为我们准备的浏览器基准测试。

这个bench主要用于考验模型在真实浏览器里操纵网站、搜索规划和填表的能力,总计有31道真实任务。

包括统计Hacker News的热门帖、 筛选IMDb 科幻电影、申请OpenAI 的职位、去Reddit找工作、填写从纽约到迈阿密的单程航班表单、通过查询就业人数和年均工资比较两个地区谁更适合零售门店扩张等等。

在跑完31道真实任务后,Qwen 3.8 Max的得分仅次于硅谷双子星Claude和GPT。


结果一目了然。横轴代表价格,竖轴代表成绩。

右上角是贵又好,GPT 5.6 Sol(跑完测试花了602元)第一、Fable 5(600元)和Opus 5(359元)其次,第四名是Qwen 3.8 Max(215元)。

值得一提的是,Qwen 3.8预览版成绩还比正式版略高一点,多做对了两道题。有波动很正常,不过也说明正式版在浏览器调用上提升不大。

必须要说明的是,这个bench是首发,绝对没有任何模型厂商刷过,纯纯靠模型本身的能力来跑。

我们很快会专门拆解各家模型在这个bench的表现,今天先只爱Qwen。

以一道亚马逊找差评的题目为例。要求各家模型去亚马逊找到一款不锈钢水杯(产品要至少有 1000 条顾客评价),通过顾客评论找到这款水杯在什么情况下会漏水,最后筛选出最有信息量的一条漏水评论:

Qwen 3.8 Max选了一款不锈钢运动水杯,有8676 条顾客评价。


接着直接开始搜索差评,逻辑清晰,页面显示找到了 28 条相关结果,最后筛选出「只要杯子倒在侧面,水就会漏,而且不管怎么拧紧盖子都没用。」这一条。


大部分模型都能搜索到水杯,但无法筛选出真实差评。

比如GLM5.2(170元)就找到了评论区,但一直都在看 AI 总结的泛评论内容,没把具体顾客的差评找出来,和它表现一样是Seed Evolving(98元),不懂这俩模型咋这么爱看AI总结呢?

接下来登场的是老朋友。

让每个模型跑10轮知识图谱构建任务,通过重复任务来考验模型的稳定性,拉出区分度。


如图所示,Qwen 3.8 Max的表现和K3、Opus 5差不多,都属于一个梯队。

考虑到Claude终于封了我的号,而中转站API因为大厂疯狂蒸馏又不太稳定,所以Opus 5分数偏低也很合理。

Qwen 3.8的优点是工程相对可靠,很少犯根本性错误,扣分点都是一些细节问题。

跑完测试花费38元API成本,略低于K3(43元),远低于GPT 5.6 Sol(87元)、Fable5(188元)和Opus 5(273元,调用次数畸高导致缓存命中成本高)。

Qwen 3.8只能说在同档次模型中有性价比。真论性价比,DeepSeek V4 Flash正式版只花了一块钱,斩杀线真是恐怖如斯。

需要说明的是,情理之中,这个测试可能已经被模型厂刷过了。

过去一个月MiniMax M3和混元Hy3跑分持续提高,终于在这周高到不正常,我加测了几轮都是这个成绩。Hy3可能是刚好提升了知识图谱相关能力,没找到把柄。

但M3就很幽默了。因为它过往要花十多分钟完成的任务,M3有一半轮次都只花了2-3分钟完成,还大都是高分,存在套模版嫌疑。下次跑bench真得换题了

上述两个测试,浏览器调用和工程稳定性都是Qwen 3.8 Max的舒适区。接下来,我们要狠狠触摸Qwen的多模态软肋了。

有请良子。

首先请各位模型根据良子照片生成3D白模。


结果一目了然,GPT 5·6 Sol是最像的。K3的脸也很像,可惜胃袋糊成了一坨,总体和脸不像但很轮廓清晰的Fable 5坐一桌。

Qwen 3.8 Max生成的还行,胃袋也糊了,但脸部很清晰地体现出良子笑得很开心。相较于预览版生成不明白模型人脸,有了不小进步。

还有乳豆环节。不知道豆姐是不是歧视良子,给你良弟整成埃及狮身人面像了。字节在Seedance上扬眉吐的气都让你豆姐暴风吸入回去

接下来是MD动画环节。有请良子和峰哥一起上。


我让几个模型根据良子峰哥玉照,自由生成30秒MD动画。尽可能发挥创意,看看大伙能整点什么活。

GPT 5·6 Sol依然是最好的,生成了一个完整的小故事。OpenAI你就学去吧,这公司比A畜全方位地强。

K3的水平就有所滑坡,远不如上次复刻自家宣传片的风采,直接给峰哥头整掉了。

这里多插一句,K3的官方API这几天很不稳定,跑ego浏览器测试遇到了8个题提前结束任务,后面都复跑了。跑葬AI测试也遇到了类似问题。可见爆款也有爆款的烦恼,算力不够确实影响用户体验。

Qwen 3.8 Max也生成了一个完整的小故事,画面虽然不如GPT 5·6 Sol,但也好过忙不过来的K3。就是画面里峰哥给良子摘果子像自己拉的,不太雅观。

Seed Evolving依旧稳定发挥,不仅给良子脱了衣服,还给你峰哥进行了一个头身分离。

由上可见,Qwen 3.8 Max正式版的多模态能力还是进步不小。我拿正式版又复刻了一次K3宣传片,和预览版产物拼到一起作对比。

一目了然,复刻得细致了不少,但依然不如。

最后总结一下吧。

Qwen 3.8 Max发挥了家族一贯特色,就是都挺好都挺强,但就差一点点。

上个赛季被GLM 5.2靠极致后训练优化编程能力压过一头,这个赛季又遇到Kimi突然憋个大的。

后者不仅领先几天发布首个2T参数开源模型,还在模型产品化前进了一步,靠极致优化前端一把梭能力,精准hack了人民群众评价模型基本只看生成漂亮网页这个既成事实,让人确实服气。

回过头看,Qwen 3.8 Max是一个足够好的模型。

它在编程能力上略微超越K3,多模态能力也补上了短板,并且定价和实际花费都略低。考虑到阿里旗下Qoder、千问办公等产品都在搞打折促销,实际使用价格会更低。

Qwen 3.8 Max也是一个开源模型。并且,小参数27B版本也将开源,再次利好搞各种神奇发明。

在其他模型厂一时半会发不出2T参数模型的前提下,Qwen和Kimi毫无疑问是开源双子星。

集美一词的发明者郭老师说,集美是集中美丽集中智慧的意思。那么,极致优化前端能力的K3可以称之为集美模型。

作为镜像,不懈努力勤劳肯干的力工,则是Qwen 3.8 Max的代名词。我们可以称之为力工模型。

集美和力工正适合一起组乐队,永远在一起❤️

然而,残酷的事实是,国产模型卷到飞起。GLM 5.3和DeepSeek V4 Pro正式版都即将发布,前者猛猛优化编程能力,后者极致性价比。

几乎所有国产模型都在按周迭代。任何一个国产模型,都最多只能领先一个月,就一定会陷入同质化竞争,直到两个月后谁憋出来个大的。

2026年下半年的残酷图景是,模型本身会越来越趋同。我们只能以一线和二线这样的粗略划分来区分模型。每个大档次内部,不同模型之间基本只有价格、速度的区别。

这说明AI应用的好日子要来啦。

因为大模型的性价比在提升,一线模型还能以几分之一Claude来定价,二线模型就只能几乎免费。模型同质化,就只能从应用找价值差异。

最大的战场,办公Agent的参赛方还在蓄力。战场角落里,类似ego (lite)和Raft这样垂直但有用的产品正在发育。

大的已经来了,还不止一个大的来。

(本文封面由ChatGPT 生成,纯人工写作)

⬇️

欢迎订阅我们的Substack

funeralai.substack.com

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
李一桐用8公斤水杯喝水,秀出手臂肌肉线条,网友笑称“每次喝水都像在撸铁”

李一桐用8公斤水杯喝水,秀出手臂肌肉线条,网友笑称“每次喝水都像在撸铁”

韩小娱
2026-09-14 15:00:31
提醒大家:洗衣机里不管有几件衣服,千万要记得放几个塑料袋

提醒大家:洗衣机里不管有几件衣服,千万要记得放几个塑料袋

三农老历
2026-09-15 04:16:12
解放军提前摸底,美军一旦对上海发动打击,中方有把握一击必胜

解放军提前摸底,美军一旦对上海发动打击,中方有把握一击必胜

吕彏极限手工
2026-09-15 17:35:20
1年5030万美金!4年1.86亿美金!NBA最强锋线双子星诞生

1年5030万美金!4年1.86亿美金!NBA最强锋线双子星诞生

微评体育圈
2026-09-17 18:13:08
斯诺克战报!6场4-0,6冠军全部进正赛,卢卡翻身,中国3人脱颖而出!

斯诺克战报!6场4-0,6冠军全部进正赛,卢卡翻身,中国3人脱颖而出!

刘姚尧的文字城堡
2026-09-17 08:09:18
全网都错了!4岁男童摸臀事件:美国司法的温柔底线,打醒无数极端舆论

全网都错了!4岁男童摸臀事件:美国司法的温柔底线,打醒无数极端舆论

浪子的烟火人间
2026-09-15 09:17:46
越南政府的决议实际上就是要扼杀广西平陆运河出海口

越南政府的决议实际上就是要扼杀广西平陆运河出海口

安安说
2026-08-31 11:15:16
九月末开始鸿运启幕,三大生肖贵人撑腰,升职加薪财库丰盈

九月末开始鸿运启幕,三大生肖贵人撑腰,升职加薪财库丰盈

情感事聊
2026-09-17 11:51:28
深圳两名33岁男子中招!一个胆囊里长出500多颗石头,一个胆囊被结石撑到20厘米

深圳两名33岁男子中招!一个胆囊里长出500多颗石头,一个胆囊被结石撑到20厘米

深圳晚报
2026-09-17 20:33:31
“快递一哥”减少低价电商件后,顺丰快递员兼职送起外卖,“能赚几毛是几毛”

“快递一哥”减少低价电商件后,顺丰快递员兼职送起外卖,“能赚几毛是几毛”

时代财经
2026-09-17 07:34:10
胡塞48小时寸步难行!空袭夹击成百上千人倒地,专家中招

胡塞48小时寸步难行!空袭夹击成百上千人倒地,专家中招

今观天下
2026-09-16 07:56:14
下午6点!CCTV5直播亚运会半决赛,两大主力或复出,郭士强欲带队复仇

下午6点!CCTV5直播亚运会半决赛,两大主力或复出,郭士强欲带队复仇

大卫的篮球故事
2026-09-17 18:20:12
国内将逐渐停止“肠息肉手术”?做完人就废了?医生讲出实情

国内将逐渐停止“肠息肉手术”?做完人就废了?医生讲出实情

垚垚分享健康
2026-09-17 12:30:08
家长试卷“签字”走红,连老师都赞叹不绝:有这样的家长未来可期

家长试卷“签字”走红,连老师都赞叹不绝:有这样的家长未来可期

犀利辣椒
2026-08-14 06:22:46
只喝烧开的自来水,不碰桶装水,不买矿泉水,最后结果如何?

只喝烧开的自来水,不碰桶装水,不买矿泉水,最后结果如何?

芹姐说生活
2026-09-15 00:56:09
两千多万人涌入,成都是否会出现类似“逃离北上广”的大潮?

两千多万人涌入,成都是否会出现类似“逃离北上广”的大潮?

椰青美食分享
2026-09-16 15:51:45
全线溃败!俄军弃守利曼北部突出部,大面积阵地彻底拱手让人

全线溃败!俄军弃守利曼北部突出部,大面积阵地彻底拱手让人

老马拉车莫少装
2026-09-08 22:48:14
中央明确了!社保最低缴费年限要提高,70、80后得早做准备

中央明确了!社保最低缴费年限要提高,70、80后得早做准备

云鹏叙事
2026-04-12 16:36:39
初代网红木子美质疑罗永浩:吃降糖药,还去吃冰淇淋?

初代网红木子美质疑罗永浩:吃降糖药,还去吃冰淇淋?

超角度
2026-09-16 13:12:54
我60岁退休请了个钟点工,才干了15天,她两个儿子竟登门找我谈养老,我看着他们,冷笑一声直接关门

我60岁退休请了个钟点工,才干了15天,她两个儿子竟登门找我谈养老,我看着他们,冷笑一声直接关门

晓艾故事汇
2026-09-17 11:20:02
2026-09-18 00:19:00
葬AI
葬AI
整点真实
155文章数 28关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

猛士X700内饰公布 打造家庭泛越野智能座舱

态度原创

数码
健康
家居
本地
公开课

数码要闻

Bose Ultra Open Earbuds夹耳式无线耳机发布,售价299美元

剧烈头痛伴呕吐,警惕脑动脉瘤破裂

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

不止胖东来!许昌藏着半部三国史

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版