网易首页 > 网易号 > 正文 申请入驻

DeepSeek、智谱、阿里、腾讯,谁是大模型真正的斩杀线?

0
分享至



来源| Tech星球

| 任雪芸

最近,大模型厂商集体看向了“Flash”。

变化可以从7月份的一个发布日开始追溯,7月21日,Google DeepMind一口气端出三款Flash模型,但旗舰Gemini 3.5 Pro缺席。

彼时,Gemini 3.6 Flash的表现被吐槽不如中国一线开源模型,但国内大模型厂商们却一同捕捉到Flash背后的产业信号,纷纷跟进布局这一效率架构路线。

十天后,国内大模型市场,DeepSeekV4 Flash正式版上线并开源,284B总参数、每次推理只激活13B。DeepSeek还调整了卖模型的方式,涨价的同时,改成了峰谷分时的计费方式。

8月26日到28日这三天,Flash成了主战场。三天至少五款重量级模型落地,但Flash版本占到了多数。

智谱把匿名刷屏“牛来”(Ox-Alpha)认领为 GLM-5.3-Flash,320B总参数,每次只激活 18B;阿里在同一天连夜放出 Qwen3.8-Flash,总参数 125B,每个token只唤醒6B参与计算。9月1日,腾讯发布了其最新一代旗舰模型预览版本Hy4 preview的轻量版模型。

上半年,大模型行业的叙事主线还停留在比拼更多数据、更多参数、更多算力,各家追求的是更大规模参数的模型。

但开源与低价的浪潮正在改写行业逻辑,过去Flash原本只是Google产品线上一个不起眼的档位,定位追求快、便宜、够用,如今新一代Flash已经进化为效率优先的架构版本,行业的比拼重心,也已经从 “谁的参数更大”,转向 “谁成本更低、更具备落地价值”。

Agent需要Flash:效率模型登上产业主舞台

如果只有三分之一的价格,已经能完成大部分日常任务,那你还会默认把所有工作交给最强模型吗?答案当然是否定的。这也是2026年下半年,DeepSeek、智谱、阿里通义扎堆推出Flash等轻量模型的现实动因。

在此之前,市场认知里的Flash,只是旗舰模型的阉割减配版本。

厂商砍掉部分模型能力,换取更快的推理速度与更低调用成本,适合做简单对话,一旦遇到复杂推理、长链路任务,就会出现明显的能力断崖下滑。Flash版本更多是作为旗舰产品的补充,承接边缘流量,很难走到业务舞台中央。

新一代Flash不是简单裁剪参数的减配思路,重点是架构层面的效率革新。依靠MoE稀疏路由机制,模型保留庞大的总参规模与完整知识底座,每一轮推理仅激活一小部分参数参与运算。

真正把Flash推到主流位置的,是AI Agent规模化的兴起。以阿里Qwen3.8Flash为例,模型发布的同时,千问办公Agent产品同步上线,模型与智能体业务的绑定趋势十分直观。

Agent的业务特性带来两层现实约束:一方面,大量工作集中在意图路由、信息抽取、工具调用等任务,并不需要旗舰模型顶尖的深度推理能力,但对推理延迟、并发承载力、调用成本高度敏感。

另一方面,完成一整套Agent业务闭环,往往需要数十次模型循环调用,倘若全部交由旗舰模型处理,成本会随调用轮次成倍膨胀,商业化规模化就无从谈起。

DeepSeek V4Flash、GLM5.3Flash、Qwen3.8Flash这类国产MoE模型,就是瞄准这类场景痛点打造的。即便旗舰模型综合能力上限更高,但高昂的调用开销与更高时延,并不适配Agent高频次、大批量的运行需求。

一夜之间模型都变便宜了,谁才是新的斩杀线?

海外独立评测社区Artificial Analysis曾实测上百款大模型,并据此画出一张性能与价格对比图。DeepSeek-V4-Flash 在这张图里成了一道醒目的“斩杀线”—— 意思是,在它的价格之下,性能比它差、价格还比它贵的模型,都不用看了。

DeepSeek过去半年的用户增长,很大一部分就是踩着这条 “斩杀线”走过来的。它不一定是同一时间段内最好的模型,但价格却足够便宜。

换句话说,现在各家推出的Flash所做的,就是在尽可能接近旗舰效果的前提下,把价格做到最低。

所以“斩杀线”从来不会只属于一家公司。

就在DeepSeek宣布涨价的节点上,低价价格带腾出了空间。随后发布的 GLM-5.3-Flash 与 Qwen3.8-Flash 几乎同一时间把价格压到同一水位,新一轮“斩杀线”之争就此开场。

具体看三家的定价策略:

GLM-5.3-Flash与Qwen3.8-Flash价格几乎持平:输入0.8元、输出约2.7–2.8元/百万tokens,双双站上行业最低档。

智谱更是叠加限时5折(至9月9日),折后输入0.4元、输出1.4元,进一步压低入场门槛。

DeepSeek则坚持峰谷定价:高峰输入3.0元、输出9.0元,空闲时段半价。平均下来约为另外两家的2–3倍,但视觉能力不额外加价,仍保留一张差异化底牌。

标价之下还有第二层。三款都支持上下文缓存,缓存命中的输入价会大幅下探,Qwen低至0.1 元/百万 tokens;对系统提示长、上下文重复度高的场景,实际账单还能再砍一截。而DeepSeek的缓存命中价在闲时只有0.05元,仍是三者最低。



便宜没有换来能力的缩水。各家自测基准几乎不重合,目前最可比的第三方口径仍是Artificial Analysis智能指数:GLM-5.3-Flash拿到57分;DeepSeek V4 Flash50分,也就是说智谱用比 DeepSeek更低的价格,拿到了高出7分的第三方评分,这一次被斩的反而是当初立线的那个。

如今,斩杀线的位置每隔几周就会往下挪一次,而每挪一次,能活下来的模型就少一批。

大模型下半场:卷性能落幕,拼的是算力与数据

上半年的叙事还是更多数据、更多参数、更多算力;到了下半年,DeepSeek、智谱、阿里、腾讯集体转身,把赌注压在“效率”两个字上。当各家Flash的权重几乎全部开源、MoE“大总参、小激活”成为行业共识的基础架构,模型厂之间的区别,正在肉眼可见地变小。

架构不再是秘密,真正难复制的只剩两样:算力规模,和数据管线。

算力这一侧,效率模型表面上是把成本打了下来,背后却有一场更烧钱的军备竞赛。

智谱动用10万张国产芯片集群支撑GLM-5.3-Flash的线上推理;MiniMax称自己是国内最早建成规模化、长期稳定基础设施体系的两家独立大模型公司之一;腾讯则罕见地公开承认“整体算力严重不足”,拖慢了混元迭代。

同一场竞争里,Flash恰恰是算力紧张时代的最优解:320B的GLM-5.3-Flash每次推理只唤醒18B,770B 的Hy4只激活49B,同样的卡能服务更多用户、摊薄更多成本。与其说厂商选择了效率路线,不如说是算力瓶颈让各家不得不去走效率路线。

但算力用钱能买到,数据却不能。

数据这一侧,预训练语料、后训练数据管线、对齐工程,才是各家真正拉开身位的地方。DeepSeek 靠强化学习与蒸馏,把推理能力压进 13B 激活的模型;Qwen在多模态语料配比上押注;智谱在数据与对齐工程上积累。

更被寄予期待的是,数据如何形成飞轮?

各家都在押注Agent,每一次 Agent 调用都是一次真实使用数据的回流,回流进训练,模型更强,便有更多Agent接入。谁先跑通 Agent 的规模化闭环,谁就同时拿到了算力之外最深的护城河。

这也是千问的Flash发布就在千问办公Agent同步上线、模型与业务绑定如此紧密的原因。

在过去卷性能的时代,大家比的是榜单。但卷效率的时代,比的是工程化的能力还有价格。如今价格战把模型压到成本线附近,模型层利润变薄,落到Agent、端侧与云服务身上的压力变得更重。

接下来模型厂商要么靠规模稳坐头部,要么靠场景做出差异化。一时的便宜不是终局,谁能在成本、效率与数据之间跑通飞轮,谁才能划出下一道斩杀线。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
尼泊尔用无人机搜救幸存者,播放歌曲等回应,隧道被泥浆“像牙膏一样”塞满

尼泊尔用无人机搜救幸存者,播放歌曲等回应,隧道被泥浆“像牙膏一样”塞满

红星新闻
2026-09-02 16:23:27
孙宇晨和景甜的瓜反转了,大量照片和聊天记录流出!

孙宇晨和景甜的瓜反转了,大量照片和聊天记录流出!

七阿姨爱八卦
2026-09-01 10:46:18
一而再再而三,皇马必须给我们一个交代!

一而再再而三,皇马必须给我们一个交代!

火锅局
2026-09-02 15:26:22
河北高阳警方通报“女子被当街殴打撕扯”:2人被刑拘

河北高阳警方通报“女子被当街殴打撕扯”:2人被刑拘

界面新闻
2026-09-02 16:13:22
媒体:邵氏武打演员陈观泰去世,曾主演电影《马永贞》

媒体:邵氏武打演员陈观泰去世,曾主演电影《马永贞》

澎湃新闻
2026-09-02 14:26:05
连续6天重击基辅,俄乌冲突新阶段:俄罗斯无人机能力大增,启动“全天候消耗方案”?

连续6天重击基辅,俄乌冲突新阶段:俄罗斯无人机能力大增,启动“全天候消耗方案”?

红星新闻
2026-09-02 15:19:43
金正恩女儿持枪开坦克,韩情报院称已进入接班人内定阶段

金正恩女儿持枪开坦克,韩情报院称已进入接班人内定阶段

桂系007
2026-09-02 10:15:38
账面328亿美元!孙宇晨公开资产估值表引热议,网友:大部分其实都不能变现

账面328亿美元!孙宇晨公开资产估值表引热议,网友:大部分其实都不能变现

火山詩话
2026-09-02 17:12:20
动真格了!国家正式出手,荒唐30年的楼市,终于被掀桌子了!

动真格了!国家正式出手,荒唐30年的楼市,终于被掀桌子了!

江启
2026-09-02 01:06:03
200亿龙头,被107个应届生上了一课

200亿龙头,被107个应届生上了一课

凤凰网财经
2026-09-01 23:50:47
科技公司高管与下属的大瓜,满屏虎狼之词,看得人面红耳赤!

科技公司高管与下属的大瓜,满屏虎狼之词,看得人面红耳赤!

葱哥说
2026-09-02 13:44:41
年薪300万!33岁前国足队长:我当年加盟广州恒大 就是因为钱多

年薪300万!33岁前国足队长:我当年加盟广州恒大 就是因为钱多

念洲
2026-09-02 09:55:08
常州女首富怒了:已投诉和举报部分媒体!

常州女首富怒了:已投诉和举报部分媒体!

深蓝财经
2026-09-02 16:32:37
孙宇晨聊天记录曝光,瓜越扒越多!

孙宇晨聊天记录曝光,瓜越扒越多!

互联网品牌官
2026-09-02 15:41:41
快手创作者如何让“垂”变成了一门可复制的生意

快手创作者如何让“垂”变成了一门可复制的生意

定焦One
2026-09-01 18:27:27
谁干的?俄罗斯军官被斩首,美英法集体沉默,普京连下三条命令

谁干的?俄罗斯军官被斩首,美英法集体沉默,普京连下三条命令

闻识
2026-09-02 11:17:04
日本前首相鸠山由纪夫公开告诫高市,中国当年放弃巨额战争赔款,附带明确的条件,相关内容早已落实在书面文件,不可肆意违背过往承诺

日本前首相鸠山由纪夫公开告诫高市,中国当年放弃巨额战争赔款,附带明确的条件,相关内容早已落实在书面文件,不可肆意违背过往承诺

唠叨说历史
2026-09-02 16:16:45
泰国真是太损了!美军五千官兵在航母上憋了200多天,终于要上岸休整了,结果泰国抢先动手连夜清查,几十名涉非法色情行业的人员被带走

泰国真是太损了!美军五千官兵在航母上憋了200多天,终于要上岸休整了,结果泰国抢先动手连夜清查,几十名涉非法色情行业的人员被带走

扶苏聊历史
2026-09-02 15:26:46
科技部党组成员、秘书长潘晓东任国家市场监管总局副局长

科技部党组成员、秘书长潘晓东任国家市场监管总局副局长

澎湃新闻
2026-09-02 18:34:26
难怪朱倩老公这次下手这么狠,这女人的聊天记录,实在是太野了

难怪朱倩老公这次下手这么狠,这女人的聊天记录,实在是太野了

皮蛋儿电影
2026-09-02 10:26:48
2026-09-02 21:20:49
Tech星球 incentive-icons
Tech星球
聚焦互联网前沿科技和新商业
2831文章数 26685关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

10万级的满配B级车 试驾2027款比亚迪海豹06

态度原创

时尚
旅游
亲子
游戏
健康

中国农村,挤满了花钱干农活的外国佬

旅游要闻

北京师范大学“九寨青禾”暑期实践队走进九寨沟景区和大录乡开展调研

亲子要闻

宝蓝和弟弟妹妹手上涂满颜料,用手掌画画,有趣又漂亮~

《FF7》蒂法惨遭DLSS5摧残!变大妈难以接受

越吃越爆痘?医生讲清7大真相

无障碍浏览 进入关怀版