网易首页 > 网易号 > 正文 申请入驻

DeepSeek、智谱、阿里、腾讯,谁是大模型真正的斩杀线?

0
分享至



来源| Tech星球

| 任雪芸

最近,大模型厂商集体看向了“Flash”。

变化可以从7月份的一个发布日开始追溯,7月21日,Google DeepMind一口气端出三款Flash模型,但旗舰Gemini 3.5 Pro缺席。

彼时,Gemini 3.6 Flash的表现被吐槽不如中国一线开源模型,但国内大模型厂商们却一同捕捉到Flash背后的产业信号,纷纷跟进布局这一效率架构路线。

十天后,国内大模型市场,DeepSeekV4 Flash正式版上线并开源,284B总参数、每次推理只激活13B。DeepSeek还调整了卖模型的方式,涨价的同时,改成了峰谷分时的计费方式。

8月26日到28日这三天,Flash成了主战场。三天至少五款重量级模型落地,但Flash版本占到了多数。

智谱把匿名刷屏“牛来”(Ox-Alpha)认领为 GLM-5.3-Flash,320B总参数,每次只激活 18B;阿里在同一天连夜放出 Qwen3.8-Flash,总参数 125B,每个token只唤醒6B参与计算。9月1日,腾讯发布了其最新一代旗舰模型预览版本Hy4 preview的轻量版模型。

上半年,大模型行业的叙事主线还停留在比拼更多数据、更多参数、更多算力,各家追求的是更大规模参数的模型。

但开源与低价的浪潮正在改写行业逻辑,过去Flash原本只是Google产品线上一个不起眼的档位,定位追求快、便宜、够用,如今新一代Flash已经进化为效率优先的架构版本,行业的比拼重心,也已经从 “谁的参数更大”,转向 “谁成本更低、更具备落地价值”。

Agent需要Flash:效率模型登上产业主舞台

如果只有三分之一的价格,已经能完成大部分日常任务,那你还会默认把所有工作交给最强模型吗?答案当然是否定的。这也是2026年下半年,DeepSeek、智谱、阿里通义扎堆推出Flash等轻量模型的现实动因。

在此之前,市场认知里的Flash,只是旗舰模型的阉割减配版本。

厂商砍掉部分模型能力,换取更快的推理速度与更低调用成本,适合做简单对话,一旦遇到复杂推理、长链路任务,就会出现明显的能力断崖下滑。Flash版本更多是作为旗舰产品的补充,承接边缘流量,很难走到业务舞台中央。

新一代Flash不是简单裁剪参数的减配思路,重点是架构层面的效率革新。依靠MoE稀疏路由机制,模型保留庞大的总参规模与完整知识底座,每一轮推理仅激活一小部分参数参与运算。

真正把Flash推到主流位置的,是AI Agent规模化的兴起。以阿里Qwen3.8Flash为例,模型发布的同时,千问办公Agent产品同步上线,模型与智能体业务的绑定趋势十分直观。

Agent的业务特性带来两层现实约束:一方面,大量工作集中在意图路由、信息抽取、工具调用等任务,并不需要旗舰模型顶尖的深度推理能力,但对推理延迟、并发承载力、调用成本高度敏感。

另一方面,完成一整套Agent业务闭环,往往需要数十次模型循环调用,倘若全部交由旗舰模型处理,成本会随调用轮次成倍膨胀,商业化规模化就无从谈起。

DeepSeek V4Flash、GLM5.3Flash、Qwen3.8Flash这类国产MoE模型,就是瞄准这类场景痛点打造的。即便旗舰模型综合能力上限更高,但高昂的调用开销与更高时延,并不适配Agent高频次、大批量的运行需求。

一夜之间模型都变便宜了,谁才是新的斩杀线?

海外独立评测社区Artificial Analysis曾实测上百款大模型,并据此画出一张性能与价格对比图。DeepSeek-V4-Flash 在这张图里成了一道醒目的“斩杀线”—— 意思是,在它的价格之下,性能比它差、价格还比它贵的模型,都不用看了。

DeepSeek过去半年的用户增长,很大一部分就是踩着这条 “斩杀线”走过来的。它不一定是同一时间段内最好的模型,但价格却足够便宜。

换句话说,现在各家推出的Flash所做的,就是在尽可能接近旗舰效果的前提下,把价格做到最低。

所以“斩杀线”从来不会只属于一家公司。

就在DeepSeek宣布涨价的节点上,低价价格带腾出了空间。随后发布的 GLM-5.3-Flash 与 Qwen3.8-Flash 几乎同一时间把价格压到同一水位,新一轮“斩杀线”之争就此开场。

具体看三家的定价策略:

GLM-5.3-Flash与Qwen3.8-Flash价格几乎持平:输入0.8元、输出约2.7–2.8元/百万tokens,双双站上行业最低档。

智谱更是叠加限时5折(至9月9日),折后输入0.4元、输出1.4元,进一步压低入场门槛。

DeepSeek则坚持峰谷定价:高峰输入3.0元、输出9.0元,空闲时段半价。平均下来约为另外两家的2–3倍,但视觉能力不额外加价,仍保留一张差异化底牌。

标价之下还有第二层。三款都支持上下文缓存,缓存命中的输入价会大幅下探,Qwen低至0.1 元/百万 tokens;对系统提示长、上下文重复度高的场景,实际账单还能再砍一截。而DeepSeek的缓存命中价在闲时只有0.05元,仍是三者最低。



便宜没有换来能力的缩水。各家自测基准几乎不重合,目前最可比的第三方口径仍是Artificial Analysis智能指数:GLM-5.3-Flash拿到57分;DeepSeek V4 Flash50分,也就是说智谱用比 DeepSeek更低的价格,拿到了高出7分的第三方评分,这一次被斩的反而是当初立线的那个。

如今,斩杀线的位置每隔几周就会往下挪一次,而每挪一次,能活下来的模型就少一批。

大模型下半场:卷性能落幕,拼的是算力与数据

上半年的叙事还是更多数据、更多参数、更多算力;到了下半年,DeepSeek、智谱、阿里、腾讯集体转身,把赌注压在“效率”两个字上。当各家Flash的权重几乎全部开源、MoE“大总参、小激活”成为行业共识的基础架构,模型厂之间的区别,正在肉眼可见地变小。

架构不再是秘密,真正难复制的只剩两样:算力规模,和数据管线。

算力这一侧,效率模型表面上是把成本打了下来,背后却有一场更烧钱的军备竞赛。

智谱动用10万张国产芯片集群支撑GLM-5.3-Flash的线上推理;MiniMax称自己是国内最早建成规模化、长期稳定基础设施体系的两家独立大模型公司之一;腾讯则罕见地公开承认“整体算力严重不足”,拖慢了混元迭代。

同一场竞争里,Flash恰恰是算力紧张时代的最优解:320B的GLM-5.3-Flash每次推理只唤醒18B,770B 的Hy4只激活49B,同样的卡能服务更多用户、摊薄更多成本。与其说厂商选择了效率路线,不如说是算力瓶颈让各家不得不去走效率路线。

但算力用钱能买到,数据却不能。

数据这一侧,预训练语料、后训练数据管线、对齐工程,才是各家真正拉开身位的地方。DeepSeek 靠强化学习与蒸馏,把推理能力压进 13B 激活的模型;Qwen在多模态语料配比上押注;智谱在数据与对齐工程上积累。

更被寄予期待的是,数据如何形成飞轮?

各家都在押注Agent,每一次 Agent 调用都是一次真实使用数据的回流,回流进训练,模型更强,便有更多Agent接入。谁先跑通 Agent 的规模化闭环,谁就同时拿到了算力之外最深的护城河。

这也是千问的Flash发布就在千问办公Agent同步上线、模型与业务绑定如此紧密的原因。

在过去卷性能的时代,大家比的是榜单。但卷效率的时代,比的是工程化的能力还有价格。如今价格战把模型压到成本线附近,模型层利润变薄,落到Agent、端侧与云服务身上的压力变得更重。

接下来模型厂商要么靠规模稳坐头部,要么靠场景做出差异化。一时的便宜不是终局,谁能在成本、效率与数据之间跑通飞轮,谁才能划出下一道斩杀线。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
不再沉默!陈妍希含泪首谈离婚,妈妈一句话,丝毫没给陈晓留面子

不再沉默!陈妍希含泪首谈离婚,妈妈一句话,丝毫没给陈晓留面子

往史过眼云烟
2026-09-02 19:35:16
回顾最绝望的死法:复旦45岁女博士倒挂长城2小时,目睹自己死亡

回顾最绝望的死法:复旦45岁女博士倒挂长城2小时,目睹自己死亡

清茶浅谈
2024-12-11 18:24:36
央视再三提醒:绑定银行卡的手机,务必开启这几项功能!

央视再三提醒:绑定银行卡的手机,务必开启这几项功能!

记录生活日常阿蜴
2026-08-12 06:02:43
中国女篮世界杯12人名单出炉!李月汝遗失护照落选,韩旭张子宇领衔

中国女篮世界杯12人名单出炉!李月汝遗失护照落选,韩旭张子宇领衔

李喜林篮球绝杀
2026-09-03 00:06:10
我们都看错了!孙颖莎的幕后导师不是邱贻可,而是准备退役的他

我们都看错了!孙颖莎的幕后导师不是邱贻可,而是准备退役的他

林轻吟
2026-08-20 09:46:49
一个王朝末期的屠夫,为何人人崇拜?

一个王朝末期的屠夫,为何人人崇拜?

历史按察使司
2026-08-31 12:22:31
首部上星AI长剧《后西游记》开播,芒果超媒等多股涨停

首部上星AI长剧《后西游记》开播,芒果超媒等多股涨停

界面新闻
2026-08-31 17:00:19
国际刑院开庭数月前,杜特尔特要求检方重新起诉自己

国际刑院开庭数月前,杜特尔特要求检方重新起诉自己

白日追梦人
2026-09-02 08:44:49
宋子文临终前终于松口:护送蒋介石回南京当天,最大的叛徒不是张学良

宋子文临终前终于松口:护送蒋介石回南京当天,最大的叛徒不是张学良

纪史行者
2026-08-31 00:30:06
泽连斯基任命乌克兰陆军司令

泽连斯基任命乌克兰陆军司令

界面新闻
2026-09-02 19:09:21
一个人蠢到家的六种表现:和傻子共振,跟小人较真,对贵人不敬

一个人蠢到家的六种表现:和傻子共振,跟小人较真,对贵人不敬

闻心品阁
2026-08-03 08:40:06
今日七月二十二,讲究:吃3样,做2样,摆2样,寓意平安富足,人旺家兴

今日七月二十二,讲究:吃3样,做2样,摆2样,寓意平安富足,人旺家兴

小茉莉美食记
2026-09-03 01:20:03
牺牲114人消灭解放军1000人,班公洛战役,印少校一人改变战局?

牺牲114人消灭解放军1000人,班公洛战役,印少校一人改变战局?

楚风说历史
2026-08-19 09:30:03
道指深夜涨超300点,科技、中概龙头走高,英伟达大涨超3%,金银双双拉升

道指深夜涨超300点,科技、中概龙头走高,英伟达大涨超3%,金银双双拉升

第一财经资讯
2026-09-03 00:11:04
外卖下半场,为何最先恢复的是美团?

外卖下半场,为何最先恢复的是美团?

道总有理
2026-09-01 20:53:59
你有洗屁股的习惯吗?医生提醒:天天洗肛门的人或能预防4种毛病

你有洗屁股的习惯吗?医生提醒:天天洗肛门的人或能预防4种毛病

芹姐说生活
2026-08-21 22:28:55
为什么今年新生名字开始回归典籍雅韵了

为什么今年新生名字开始回归典籍雅韵了

风铃草语
2026-09-02 06:48:02
为什么美国非要把中国挤出全球体系?

为什么美国非要把中国挤出全球体系?

小眼睛小世界
2026-09-02 04:19:01
华为交了份“上市公司不敢交”的财报:净利润腰斩、现金流负400亿

华为交了份“上市公司不敢交”的财报:净利润腰斩、现金流负400亿

大卫聊科技
2026-09-02 13:33:56
“艾森豪威尔看到特朗普这样,棺材板都压不住了”

“艾森豪威尔看到特朗普这样,棺材板都压不住了”

观察者网
2026-09-01 20:55:18
2026-09-03 03:20:49
Tech星球 incentive-icons
Tech星球
聚焦互联网前沿科技和新商业
2831文章数 26685关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

游客拍下疑冰崩画面:土石翻涌 山间有黑色物体涌出

头条要闻

游客拍下疑冰崩画面:土石翻涌 山间有黑色物体涌出

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

星宇股份的麻烦,才刚开始

汽车要闻

配双腔空悬+机械差速锁 传祺越7预售权益价17.18万起

态度原创

教育
游戏
本地
艺术
军事航空

教育要闻

一学期只能紧急上一次厕所!县中越卷越离谱,学生憋尿能上清北?

《CS2》凉了吗?玩家人数创两年来新低 问题出在哪

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

艺术要闻

杨超越的汉服只能排第二?这位神秘女子一出现,整个汉服圈都炸了!

军事要闻

特朗普威胁伊朗终极打击蓄势待发

无障碍浏览 进入关怀版