网易首页 > 网易号 > 正文 申请入驻

Qwen 3.8升级纯血力工模型

0
分享至


下次别做汪峰了

Qwen 3.8 Max是一个很适合干活的模型。

它的编程和Agent能力,稳定地呈现出一流模型水平,仅次于GPT 5.6 Sol和Fable/Opus 5,略微超越K3。所以阿里可以在宣传里强调「编程与办公,全面跃升」。

在葬AI和AI浏览器ego (lite)合作的浏览器专项测试中,Qwen 3.8 Max也是一流水平,仅次于硅谷双子星。这块后文会专门展开。

Qwen 3.8的软肋在多模态和一次性生成能力。最典型的场景是一次性生成漂亮网页和小游戏,这一块Qwen 3.8显著落后K3,后者专门优化了这块能力。

所以,评价Qwen 3.8 Max是一个定位问题。

Qwen 3.8 Max没有在模型产品化上多做一步,导致用户很难靠生成一两个小游戏觉得模型牛逼。它不是一个独立的模型产品,而是一个为集团业务服务,能力相对均衡稳定的基座模型。

让我们来逐项充分检验Qwen 3.8 Max的能力。

首先登场的是ego (lite)为我们准备的浏览器基准测试。

这个bench主要用于考验模型在真实浏览器里操纵网站、搜索规划和填表的能力,总计有31道真实任务。

包括统计Hacker News的热门帖、 筛选IMDb 科幻电影、申请OpenAI 的职位、去Reddit找工作、填写从纽约到迈阿密的单程航班表单、通过查询就业人数和年均工资比较两个地区谁更适合零售门店扩张等等。

在跑完31道真实任务后,Qwen 3.8 Max的得分仅次于硅谷双子星Claude和GPT。


结果一目了然。横轴代表价格,竖轴代表成绩。

右上角是贵又好,GPT 5.6 Sol(跑完测试花了602元)第一、Fable 5(600元)和Opus 5(359元)其次,第四名是Qwen 3.8 Max(215元)。

值得一提的是,Qwen 3.8预览版成绩还比正式版略高一点,多做对了两道题。有波动很正常,不过也说明正式版在浏览器调用上提升不大。

必须要说明的是,这个bench是首发,绝对没有任何模型厂商刷过,纯纯靠模型本身的能力来跑。

我们很快会专门拆解各家模型在这个bench的表现,今天先只爱Qwen。

以一道亚马逊找差评的题目为例。要求各家模型去亚马逊找到一款不锈钢水杯(产品要至少有 1000 条顾客评价),通过顾客评论找到这款水杯在什么情况下会漏水,最后筛选出最有信息量的一条漏水评论:

Qwen 3.8 Max选了一款不锈钢运动水杯,有8676 条顾客评价。


接着直接开始搜索差评,逻辑清晰,页面显示找到了 28 条相关结果,最后筛选出「只要杯子倒在侧面,水就会漏,而且不管怎么拧紧盖子都没用。」这一条。


大部分模型都能搜索到水杯,但无法筛选出真实差评。

比如GLM5.2(170元)就找到了评论区,但一直都在看 AI 总结的泛评论内容,没把具体顾客的差评找出来,和它表现一样是Seed Evolving(98元),不懂这俩模型咋这么爱看AI总结呢?

接下来登场的是老朋友。

让每个模型跑10轮知识图谱构建任务,通过重复任务来考验模型的稳定性,拉出区分度。


如图所示,Qwen 3.8 Max的表现和K3、Opus 5差不多,都属于一个梯队。

考虑到Claude终于封了我的号,而中转站API因为大厂疯狂蒸馏又不太稳定,所以Opus 5分数偏低也很合理。

Qwen 3.8的优点是工程相对可靠,很少犯根本性错误,扣分点都是一些细节问题。

跑完测试花费38元API成本,略低于K3(43元),远低于GPT 5.6 Sol(87元)、Fable5(188元)和Opus 5(273元,调用次数畸高导致缓存命中成本高)。

Qwen 3.8只能说在同档次模型中有性价比。真论性价比,DeepSeek V4 Flash正式版只花了一块钱,斩杀线真是恐怖如斯。

需要说明的是,情理之中,这个测试可能已经被模型厂刷过了。

过去一个月MiniMax M3和混元Hy3跑分持续提高,终于在这周高到不正常,我加测了几轮都是这个成绩。Hy3可能是刚好提升了知识图谱相关能力,没找到把柄。

但M3就很幽默了。因为它过往要花十多分钟完成的任务,M3有一半轮次都只花了2-3分钟完成,还大都是高分,存在套模版嫌疑。下次跑bench真得换题了

上述两个测试,浏览器调用和工程稳定性都是Qwen 3.8 Max的舒适区。接下来,我们要狠狠触摸Qwen的多模态软肋了。

有请良子。

首先请各位模型根据良子照片生成3D白模。


结果一目了然,GPT 5·6 Sol是最像的。K3的脸也很像,可惜胃袋糊成了一坨,总体和脸不像但很轮廓清晰的Fable 5坐一桌。

Qwen 3.8 Max生成的还行,胃袋也糊了,但脸部很清晰地体现出良子笑得很开心。相较于预览版生成不明白模型人脸,有了不小进步。

还有乳豆环节。不知道豆姐是不是歧视良子,给你良弟整成埃及狮身人面像了。字节在Seedance上扬眉吐的气都让你豆姐暴风吸入回去

接下来是MD动画环节。有请良子和峰哥一起上。


我让几个模型根据良子峰哥玉照,自由生成30秒MD动画。尽可能发挥创意,看看大伙能整点什么活。

GPT 5·6 Sol依然是最好的,生成了一个完整的小故事。OpenAI你就学去吧,这公司比A畜全方位地强。

K3的水平就有所滑坡,远不如上次复刻自家宣传片的风采,直接给峰哥头整掉了。

这里多插一句,K3的官方API这几天很不稳定,跑ego浏览器测试遇到了8个题提前结束任务,后面都复跑了。跑葬AI测试也遇到了类似问题。可见爆款也有爆款的烦恼,算力不够确实影响用户体验。

Qwen 3.8 Max也生成了一个完整的小故事,画面虽然不如GPT 5·6 Sol,但也好过忙不过来的K3。就是画面里峰哥给良子摘果子像自己拉的,不太雅观。

Seed Evolving依旧稳定发挥,不仅给良子脱了衣服,还给你峰哥进行了一个头身分离。

由上可见,Qwen 3.8 Max正式版的多模态能力还是进步不小。我拿正式版又复刻了一次K3宣传片,和预览版产物拼到一起作对比。

一目了然,复刻得细致了不少,但依然不如。

最后总结一下吧。

Qwen 3.8 Max发挥了家族一贯特色,就是都挺好都挺强,但就差一点点。

上个赛季被GLM 5.2靠极致后训练优化编程能力压过一头,这个赛季又遇到Kimi突然憋个大的。

后者不仅领先几天发布首个2T参数开源模型,还在模型产品化前进了一步,靠极致优化前端一把梭能力,精准hack了人民群众评价模型基本只看生成漂亮网页这个既成事实,让人确实服气。

回过头看,Qwen 3.8 Max是一个足够好的模型。

它在编程能力上略微超越K3,多模态能力也补上了短板,并且定价和实际花费都略低。考虑到阿里旗下Qoder、千问办公等产品都在搞打折促销,实际使用价格会更低。

Qwen 3.8 Max也是一个开源模型。并且,小参数27B版本也将开源,再次利好搞各种神奇发明。

在其他模型厂一时半会发不出2T参数模型的前提下,Qwen和Kimi毫无疑问是开源双子星。

集美一词的发明者郭老师说,集美是集中美丽集中智慧的意思。那么,极致优化前端能力的K3可以称之为集美模型。

作为镜像,不懈努力勤劳肯干的力工,则是Qwen 3.8 Max的代名词。我们可以称之为力工模型。

集美和力工正适合一起组乐队,永远在一起❤️

然而,残酷的事实是,国产模型卷到飞起。GLM 5.3和DeepSeek V4 Pro正式版都即将发布,前者猛猛优化编程能力,后者极致性价比。

几乎所有国产模型都在按周迭代。任何一个国产模型,都最多只能领先一个月,就一定会陷入同质化竞争,直到两个月后谁憋出来个大的。

2026年下半年的残酷图景是,模型本身会越来越趋同。我们只能以一线和二线这样的粗略划分来区分模型。每个大档次内部,不同模型之间基本只有价格、速度的区别。

这说明AI应用的好日子要来啦。

因为大模型的性价比在提升,一线模型还能以几分之一Claude来定价,二线模型就只能几乎免费。模型同质化,就只能从应用找价值差异。

最大的战场,办公Agent的参赛方还在蓄力。战场角落里,类似ego (lite)和Raft这样垂直但有用的产品正在发育。

大的已经来了,还不止一个大的来。

(本文封面由ChatGPT 生成,纯人工写作)

⬇️

欢迎订阅我们的Substack

funeralai.substack.com

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
合资车BBA全面崩盘,大降价时代又来了。

合资车BBA全面崩盘,大降价时代又来了。

流苏晚晴
2026-09-16 12:07:25
北大严选?北大发“落实过紧日子要求”的通知,禁止去21个景区开会

北大严选?北大发“落实过紧日子要求”的通知,禁止去21个景区开会

趣笔谈
2026-09-16 09:09:47
明天正式开播!许凯领衔主演,女主是我喜欢的

明天正式开播!许凯领衔主演,女主是我喜欢的

小邵说剧
2026-09-17 07:54:45
阿根廷之所以大老远把牛肉便宜卖到中国,是因为中国什么部位都要

阿根廷之所以大老远把牛肉便宜卖到中国,是因为中国什么部位都要

流苏晚晴
2026-09-15 12:17:39
郭士强这盘大棋下得真绝,赵嘉义就是他留给日本的“定时炸弹”!

郭士强这盘大棋下得真绝,赵嘉义就是他留给日本的“定时炸弹”!

破镜难圆
2026-09-17 14:01:18
13岁女儿说肚子里有东西在动,我带她去了医院,检查结果让我傻眼

13岁女儿说肚子里有东西在动,我带她去了医院,检查结果让我傻眼

千秋文化
2026-09-17 20:10:50
我退休金7860,找了个53岁农村老伴,她说每月给6230,其他不用管

我退休金7860,找了个53岁农村老伴,她说每月给6230,其他不用管

风起见你
2026-09-17 11:01:23
受够了逆天女装,年轻女孩们开始手搓内裤

受够了逆天女装,年轻女孩们开始手搓内裤

她刊
2026-09-16 21:08:48
山东泰山队理想型主教练,以进攻为主,球队的控球率与胜率是正比

山东泰山队理想型主教练,以进攻为主,球队的控球率与胜率是正比

足球分析员
2026-09-17 11:00:04
副乳都出来了!演员彭小苒上热搜,直播间的网友看不过去了

副乳都出来了!演员彭小苒上热搜,直播间的网友看不过去了

乡野小珥
2026-09-16 12:56:39
中共四川省委组织部发布干部任前公示

中共四川省委组织部发布干部任前公示

秀我广元
2026-09-17 15:27:15
没被死刑吓退!郑筱萸被执行死刑20年后又一任被判处14年。附郑的绝笔信

没被死刑吓退!郑筱萸被执行死刑20年后又一任被判处14年。附郑的绝笔信

金水路7号站
2026-09-16 18:06:47
广西遗产案舆论升级!不要喷法官,可怜的法官只是给难住了,只须在庭审问女方:这个孩子是不是你与丈夫所生?网友抛出“绝招”引热议

广西遗产案舆论升级!不要喷法官,可怜的法官只是给难住了,只须在庭审问女方:这个孩子是不是你与丈夫所生?网友抛出“绝招”引热议

火山詩话
2026-09-17 05:50:34
原来他俩是敬一丹弟弟!如今身居高位,手足四人名字细品大有乾坤

原来他俩是敬一丹弟弟!如今身居高位,手足四人名字细品大有乾坤

大鱼简科
2026-09-17 11:53:44
央视曝光“夺命毒衣服”,致癌物超标20多倍!这4种衣服谨慎购买

央视曝光“夺命毒衣服”,致癌物超标20多倍!这4种衣服谨慎购买

39健康网
2026-09-16 09:05:47
何意味?马杜埃凯清空了社媒,仅保留阿森纳、英格兰队的标签

何意味?马杜埃凯清空了社媒,仅保留阿森纳、英格兰队的标签

懂球帝
2026-09-17 13:27:04
官宣!恭喜胡明轩!中国男篮等了整整24年

官宣!恭喜胡明轩!中国男篮等了整整24年

篮球实战宝典
2026-09-17 17:22:59
终于有人替超2亿灵活就业者说话了!人大代表提出:缴费年限守住15年、女性50岁男性60岁退休、生活困难可退个人缴费、到龄不够允许补缴

终于有人替超2亿灵活就业者说话了!人大代表提出:缴费年限守住15年、女性50岁男性60岁退休、生活困难可退个人缴费、到龄不够允许补缴

扶苏聊历史
2026-09-09 18:28:50
梅根发布生日祝福,配上两个孩子照片,为挚爱的男人庆生

梅根发布生日祝福,配上两个孩子照片,为挚爱的男人庆生

谈点世
2026-09-15 21:45:51
和讯信息房勇:只要你持仓在硬科技大主线里,千万不要频繁乱换股

和讯信息房勇:只要你持仓在硬科技大主线里,千万不要频繁乱换股

和讯网
2026-09-17 12:24:37
2026-09-17 22:52:49
葬AI
葬AI
整点真实
155文章数 28关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

男子称妻子转移1400万后提离婚 妻子:全用于生活和工作

头条要闻

男子称妻子转移1400万后提离婚 妻子:全用于生活和工作

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

猛士X700内饰公布 打造家庭泛越野智能座舱

态度原创

房产
健康
游戏
艺术
公开课

房产要闻

突发!三亚安居房出台新政!

剧烈头痛伴呕吐,警惕脑动脉瘤破裂

索尼Project Canis掌机参数曝光 目标2027年底推出

艺术要闻

海因里希·伯默:德国写实风景画家

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版