网易首页 > 网易号 > 正文 申请入驻

DeepSeek 的斩杀线一夜被斩杀,便宜大碗才是真旗舰

0
分享至

刷屏快一周的匿名模型「牛来」,正式揭晓了真身。

8 月 26 日晚,智谱正式上线并开源了 GLM-5.3 Flash,确认它就是 8 月 20 日起以 Ox-Alpha 代号,在大模型聚合平台 OpenRouter 和 OpenCode 上匿名测试的那个模型。


说起来,这是智谱第二次用这种匿名模型先免费跑一周赚流量,然后再官宣认领,上次是「马来」。春节前夕的 Pony-Alpha,后来被证明是 GLM-5。

就在同一晚,阿里也发布了一款新模型,且一样是 Flash 款。Qwen3.8-Flash 正式在大模型开源平台 Hugging Face,和阿里的模型开源社区魔搭 ModelScope 开源权重。

特别的是,千问这款新模型,虽然是 Flash,但是却作为 Qwen4 架构的早期预览版,用的是下一代 Qwen4 模型的新架构。


架构之外,两个新模型的 benchmark 数据和具体表现,也一点不像是原本我们对 Flash 的印象,即旗舰/Pro 模型的删减版。

GLM-5.3-Flash 拥有百万上下文,也是 GLM-5 系列的第一个原生多模态模型,图片、视频、文件、Coding,以及 Computer Use 这些功能现在全部靠模型就能做到。

Qwen3.8-Flash 同样保留百万上下文、图像和视频输入,结合千问办公,生成速度提升 100%,Token 消耗减少 75%。


图|GLM-5.3 Flash 在多个 benchmark 上的表现基本在 Opus 4.8 的水平

与此同时,极致性价比和普惠是这两款模型的定位。GLM-5.3-Flash 的定价前所未有,限时折扣内每百万 Token 输入是 0.4 元,输出 1.4 元,缓存命中 0.115 元,是 GLM-5.3 的 1/20。

Qwen3.8-Flash 的价格同样感人,每百万 Tokens 输入仅 1 元、输出 3 元,是 Qwen3.8-Max 的 1/12。

作为对比,现阶段涨价后的 DeepSeek V4 Flash 价格是每百万 Token 输入是 1.5 元,输出 4.5 元,缓存命中 0.05 元,而高峰时段还是空闲时段的两倍。目前高峰时段为北京时间周一至周五 9:00 - 12:00、14:00 - 18:00,其余为空闲时段。

一边要比较模型界的「拼多多」DeepSeek V4 Flash 的价格,一边又要比较智能上限,动不动就对标 Claude Opus 5、Fable 5 等。


图|DeepSeek V4 系列模型价格,从左至右为 V4 Flash、V4 Pro、V4 Flash Vision 实验版

Flash 似乎正在摆脱过去「砍参数、砍多模态、砍上下文」换低价的定位,从一句「够用就好」,变成大模型厂商新的竞争重点。

和 Opus 4.8 得分持平

OpenCode 的界面仍然显示着,ox-alpha 有 50.5 万个独立用户标识,累计消耗 Token 达到了 44T,完成超过 1300 万个会话,输入 Token 的缓存比例达到 93%。

这些数字能证明大量调用发生在 Coding Agent 平台,即便是匿名身份也没有阻挡住开发者对这款新模型的使用热情。


持续的调用,让这个「牛来」模型终结了 DeepSeek 在 OpenCode 上长达 56 天的霸榜。

而来自模型调用的算力压力,智谱后续则提到,这些请求流量全部由国产芯片提供算力支持,他们调用了超过 10 万张国产芯片做推理服务,并在技术文档中表示其集群「硬件效率及单位 token 成本已经达到了与主流英伟达 GPU 相当的水平」。

我们简单测试了一下 GLM-5.3-Flash 的能力,目前它在智谱官方的 Coding Agent 平台 ZCode 上可以直接体验。官方平台的 BigModel、Coding Plan 等 API 接入也已经开启调用。


多模态的视觉能力是 GLM-5.3-Flash 的新增能力,我们上传了 X 上最近比较火的二维码项目视频。平视是一棵树,但是当我们拖拽鼠标切换不同视角,俯视时,这棵像素块组成的树就变成了一个可扫描的二维码。

GLM-5.3-Flash 可以自动读取视频,但工作时间和我们之前的测试一样,ZCode 要花较长的时间进行思考。似乎并没有因为模型是 Flash,而导致任务的执行时间有变短。

最终实现的项目也是可以用的,但是如动图所示,整个网页非常卡顿。


我们要求 GLM-5.3-Flash 分析卡顿原因,它自己也提到,之前的实现每一帧都要重新绘制整个场景。

而整个场景有将近 1300 块地砖,每块最多 5 个面(顶面 + 4 面墙),再加投影计算里每点都算一遍三角函数,鼠标拖拽的每帧,就有约 6000 次路径填充、2 万次三角函数,60fps 下非常吃力。

修复之后的版本要好上不少,动画更加丝滑,拖拽也不卡顿,切换主题样式时渲染都更快。


而整个项目从读取视频,到实现这个 3D 效果的二维码网页,以及二次修改;ZCode 内显示的应用用量消耗是将近 3000 万 Token,个人套餐内的 5h 剩余额度还有 98%,每周额度则是剩余 99%。



我们继续使用 GLM-5.3-Flash 进行测试,模型的多模态能力很好地帮助 ZCode 可以持续截图,通过视觉识别自身生成的内容,以及用「试玩」等方式来找到输出结果中不合理的部分。

同样是之前在 X 上比较热门的中国宝塔案例,模型需要使用 3D 库, 生成一座中国宝塔,朱漆绿釉,顶部饰以鎏金的完整搭建过程。


GLM-5.3-Flash 似乎参考了二维码花园的项目,导致这个中国宝塔也采用了和之前一样的像素风格,整个用时 57 分钟,消耗 Token 大约在 1500 万左右。

可以说,至少在我们的这轮测试里,GLM-5.3-Flash 和 GLM-5.3 的体验差距并没有价格差距 20 倍那么大。

注意力计算量、KV 缓存、激活参数和总参数可能已经发生了很大变化,但落到常规网页开发、研究报告等实际任务上,这些差异并不明显,GLM-5.3-Flash 也可以胜任。

Flash 正在越过斩杀线

同一晚发布的另一款 Flash 模型,也不「Flash」。

Qwen3.8-Flash 主模型 125B 参数,外加 51B 的 N-gram Embedding,每 token 只激活 6B 参数;原生支持 26.2 万 token 上下文,可通过 YaRN(Yet another RoPE extensioN)扩展到 100 万。

更特别的是,它直接采用了下一代 Qwen4 的新架构。相比 Qwen3.7-Plus,通过架构和注意力机制内核的调整,整体训练成本降到约九分之一,编码和办公任务反而更强。


前段时间,我们在《》里给「斩杀线」下过一个定义: 足够高的任务完成率 × 足够低的总任务成本,从而夺走默认调用位 。

当时看这似乎是 DeepSeek 的单点优势,毕竟一直以来的印象,卷价格,没有人能做到比 DeepSeek 低,智能水平,DeepSeek 也并不会让人失望。

随着智谱发布价格更低的 GLM-5.3-Flash,千问也发布未来结构、价格同样便宜的 Qwen3.8 Flash,所谓的斩杀线已经不再是 DeepSeek 这一家模型厂商的叙事,更像是整个做大模型行业的新规则。


根据 Artificial Analysis 的测算结果,GLM-5.3-Flash 单次任务的成本比 DeepSeek V4 Flash 低,且智能水平要比 V4 Flash 和 V4 Pro 都要高。

当百万上下文、原生多模态和 Coding Agent 开始成为标配,模型厂商正在做同一件事: 把过去接近旗舰级的能力,压进 Flash 的价格带。


图|最近一个月发布的 Flash 模型情况

有意思的是,从今年 2 月发布 Gemini 3.1 Pro 之后,Google 就再没发过任何 Pro 模型。他们在五月发布 Gemini 3.5 Flash、七月发布 Gemini 3.6 Flash、八月发布 Gemini 3.7 Flash……

现在看来,原来 Google 一直发布 Flash 是看中了这块斩杀线。


过去的 Flash 依靠削减能力,比如缩减上下文、剥离多模态来换取低价,匹配对应的市场;而现在的 Flash 保持功能全量,仅通过极低的高效激活参数,像是百亿级激活/几百亿总参数,来压缩单 Token 边际成本。

在眼下「无处不消耗 Token」的背景下,让更多的用户可以大胆地在后台运行着一个自己的「全天候 Agent」,或工作中小到转换图片格式、文档格式这样的工作,都能直接丢给 AI。


而更昂贵的旗舰模型,在更多的时候则是退到了非选不可的情况,只有我们在触发到任务困难、Flash 做不好的情况,或者让 Pro 决策,用 Flash 执行等。

另一方面,Flash 带来的变化也在模型迭代路径上体现,过去是「旗舰先发 $\rightarrow$ 蒸馏缩小 $\rightarrow$ 推出 Flash」;现在则演变为「高效架构(如新型 MoE、预测草稿 Token)先在 Flash 验证 $\rightarrow$ 再拓展至旗舰」。

效率工程本身成为了行业的最前沿,Flash 架构的创新密度甚至开始超越旗舰。


所以今天再问什么是 Flash,答案已经变了。以前,它意味着更快、更便宜的轻量模型;现在,它代表的是 足够高的任务完成率,以及足够低的任务成本。

哪怕生成速度只有 50 Token/s,只要它拥有视觉自检与长文本推理能力,能稳妥跑完耗时 10 分钟的复杂 Coding 或办公工作流, 它在商业层面就已经斩断了传统低端模型的生存空间 。

过去,我们总想默认使用「最聪明的模型」。接下来,默认调用位可能属于那个足够聪明、足够便宜,因此可以放心一直开着的模型。

这是 Flash 越过斩杀线之后带来的变化,旗舰模型决定 AI 的上限,而 Flash 决定我们每天到底用哪个 AI。

我们正在招募伙伴

简历投递邮箱hr@ifanr.com

✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
央行行长潘功胜,最新发声

央行行长潘功胜,最新发声

证券时报
2026-09-02 19:26:05
中一签或赚超28万!国产GPU四小龙之一,今日申购

中一签或赚超28万!国产GPU四小龙之一,今日申购

21世纪经济报道
2026-09-02 07:50:40
全红婵近照变化太大了,熬过了最难的发育关,小姑娘彻底长开了,模样跟以前判若两人

全红婵近照变化太大了,熬过了最难的发育关,小姑娘彻底长开了,模样跟以前判若两人

In风尚
2026-08-22 06:04:58
马斯克:穷人之所以穷,只有一个原因——没看透人与人之间利益交换的本质

马斯克:穷人之所以穷,只有一个原因——没看透人与人之间利益交换的本质

杏花烟雨江南的碧园
2026-08-20 11:15:03
莱万:皇马有新援和穆帅加入后感觉更强了,但我始终支持巴萨

莱万:皇马有新援和穆帅加入后感觉更强了,但我始终支持巴萨

懂球帝
2026-09-02 18:28:09
吴石案终极潜伏者隐姓 42 年,晚年返大陆热泪盈眶

吴石案终极潜伏者隐姓 42 年,晚年返大陆热泪盈眶

唠叨说历史
2026-01-07 12:42:21
大开眼界!许家印当年奢靡生活曝光

大开眼界!许家印当年奢靡生活曝光

麦杰逊
2026-08-23 15:09:25
全能天才!阿森纳压哨截胡曼联!完美复刻厄德高 + 斯凯利

全能天才!阿森纳压哨截胡曼联!完美复刻厄德高 + 斯凯利

澜归序
2026-09-02 08:17:16
胡军李乃文“大闹”内娱综艺,今年最好笑的节目

胡军李乃文“大闹”内娱综艺,今年最好笑的节目

娱乐圈十三太保
2026-09-02 16:38:02
深圳将新增一家山姆会员店!

深圳将新增一家山姆会员店!

深圳晚报
2026-09-02 16:31:56
我国每年近千万人做肠镜!医生直言:做一次肠镜,或管十年无碍

我国每年近千万人做肠镜!医生直言:做一次肠镜,或管十年无碍

芹姐说生活
2026-08-26 23:55:43
有本事多重要?20万天价富豪饭局,张雪一分没花,一句话道破玄机

有本事多重要?20万天价富豪饭局,张雪一分没花,一句话道破玄机

秋姐居
2026-09-02 10:04:25
“半月工资仅55元,被踢出845个工作群”,官方回应:用人单位已全额支付判决确定的费用,针对该员工新提出的社保相关诉求,将会同有关部门进行核处

“半月工资仅55元,被踢出845个工作群”,官方回应:用人单位已全额支付判决确定的费用,针对该员工新提出的社保相关诉求,将会同有关部门进行核处

每日经济新闻
2026-09-01 19:34:59
燃气公司上门安检,根本不是查漏气!真正目的其实是这三件事

燃气公司上门安检,根本不是查漏气!真正目的其实是这三件事

阿离家居
2026-08-31 03:09:49
半年亏21亿,智谱开网店卖token

半年亏21亿,智谱开网店卖token

观察者网
2026-09-02 15:30:40
什么情况?范子铭首发登场30分钟10中1 手感不佳连续秀中投惹争议

什么情况?范子铭首发登场30分钟10中1 手感不佳连续秀中投惹争议

狼叔评论
2026-09-02 20:12:03
媒体人:国家不欠刘翔的!他自己非要留在体制内 享受最顶级待遇

媒体人:国家不欠刘翔的!他自己非要留在体制内 享受最顶级待遇

念洲
2026-08-30 09:09:35
iPhone Ultra 要发布了!直接提前看

iPhone Ultra 要发布了!直接提前看

花果科技
2026-09-02 13:54:13
一个巴西球员,在中国赚了9.4亿:钱从哪来的,最后谁买单

一个巴西球员,在中国赚了9.4亿:钱从哪来的,最后谁买单

生活新鲜市
2026-08-23 05:24:19
76岁大爷每天暴走2万步,退休金8000,最后死在睡梦中

76岁大爷每天暴走2万步,退休金8000,最后死在睡梦中

小鹿姐姐情感说
2026-09-01 11:37:45
2026-09-02 20:56:49
AppSo incentive-icons
AppSo
让智能手机更好用的秘密
6759文章数 26904关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

10万级的满配B级车 试驾2027款比亚迪海豹06

态度原创

时尚
艺术
游戏
教育
公开课

中国农村,挤满了花钱干农活的外国佬

艺术要闻

明代隐藏的“草书奇才”!水平不输张旭、怀素,当今知道他的人不足1%

《FF7》蒂法惨遭DLSS5摧残!变大妈难以接受

教育要闻

随州一中2026年秋季开学典礼隆重举行

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版