网易首页 > 网易号 > 正文 申请入驻

“大”模型向左,“Flash”向右:国内外开卷轻量化背后的商业清算

0
分享至

文 | 大模型之家

在尺度法则正在失效的当下,大模型从技术内核到商业定价的转向也在同时加速发生。

美国时间9月2日,谷歌推出Gemini 3.8 Flash和网络安全版本3.8 Flash Cyber。而在上月,大模型行业更是迎来了一波“Flash风暴”:8月26日晚间,智谱正式认领了过去一周在海外OpenRouter与OpenCode社区引发轰动的神秘模型Ox Alpha,证实其真实身份为GLM-5.3-Flash。这款拥有3200亿总参数但单Token仅激活180亿参数的混合专家模型,在盲测阶段创下了每日100万亿Token的调用流量。紧接着的8月27日中午,阿里云发布通知,正式下调百炼平台上的Qwen3.8-Flash计费单价,将输入与输出价格分别压低至0.8元每百万Token与2.7元每百万Token。

放眼AI的竞争格局,谷歌将Gemini Flash作为Android端侧与Workspace工作流的默认骨干,DeepSeek则一直在架构演进中将低成本推理作为标准配置。

过去,带有FlashMini后缀的模型往往被视为全量旗舰模型的裁剪阉割版,是厂商在客户预算不足时给出的妥协替代品。然而如今,Flash模型已然冲上牌桌中央,成为巨头抢占生态入口、争夺API吞吐量的核心主力。这场开卷轻量化模型的运动,本质上是整个人工智能产业从智商狂热走向投资回报率救赎的商业清算。

当C端流量流血,B端API必须算清经济账

为什么巨头突然不在参数量上卷死对方,转而疯狂卷Flash模型?想知道这个问题的答案,还要看那些使用AI的大模型厂商最新的财报。

8月26日下午,港股上市的大模型企业MiniMax发布了2026年中期业绩报告。财报数据显示,MiniMax上半年实现总收入约1.2亿美元,约合8.06亿元人民币,同比增长283.1%。在这份亮眼的成绩单背后,结构性的变化更为惊人:其开放平台及AI企业服务,也就是B端业务收入达到7390万美元,同比暴增703.1%,收入占比由上年同期的不足三成猛增至六成以上。

财报揭示了一个行业真相:C端娱乐应用或聊天套壳订阅付费的商业故事难以维持,真正能为大模型公司提供上亿美元现金流的,是B端企业的业务工作流与API调用。

然而,B端客户的钱从来不好拿。在企业级场景中,大模型的引入正在从单轮问答演进为智能体多轮协同。在自动化代码生成、多步工作流路由或复杂文档解析中,完成一个业务闭环往往需要触发数十次底层模型的连续调用。

此时,成本成了大模型是否能被长期采用的硬性指标之一。如果全部采用千亿甚至万亿参数的闭源旗舰模型,单次Agent任务运行的API成本可能高达数美元。对于绝大多数SaaS厂商或企业IT部门而言,这无异于利润倒挂。企业客户在看完天价账单后掉头就跑,导致大模型落地陷入了演示惊艳、交付即亏损的死循环。

更为严峻的挑战来自于模型厂商与云巨头自身的算力承载极限。

训练成本是一次性沉没成本,而推理成本则随着业务调用量呈现无边界的线性累加。如果全网的低价值Token,如文本清洗、日志分类、简单的JSON格式转换,都在消耗顶级旗舰模型的算力,云计算数据中心将迅速陷入显存与算力的耗尽状态。如果不推行Flash架构,模型厂商调用量越大,亏损就越严重。

推出Flash模型,不仅是厂商给客户降本,更是模型厂商为了防止自己被海量推理调用拖垮而发起的工程自救。

稀疏化、混合注意力与国产算力的降维打击

Flash模型并非简单地减少神经网络层数或做量化压缩,其核心逻辑在于:维持百亿乃至千亿级参数的知识记忆容量,同时将单个Token处理时的计算激活量压缩至极限。


图为GLM-5.3-Flash各项跑分成绩,来源:智谱BigModel平台

以智谱GLM-5.3-Flash为例,其技术架构呈现了极强的工程降维特征。

首先是稀疏激活的极限运用。GLM-5.3-Flash的总参数量达到了3200亿,但通过精准的专家路由机制,每次处理Token时仅激活约180亿参数。模型网络层数从前代的92层精简至45层。这意味着它用18B的推理算力开销,维持了320B参数量所沉淀的领域知识。

其次是注意力机制的结构性瘦身。传统Transformer架构中,随着上下文长度增长,键值缓存对显存的吞吐压力呈二次方上升。GLM-5.3-Flash采用了稀疏注意力与线性注意力结合的混合架构,使其注意力计算量相比主模型降低了3.01倍,键值缓存显存占用降低了4.44倍。

最后是软硬件一体化的深度解耦。令人瞩目的不仅是算法,更是硬件承载方式。根据智谱公布的数据,Ox-Alpha盲测期间每日100万亿Token的庞大流量,完全运行在超过10万张国产AI加速芯片组成的集群之上。通过搭配SGLang推理引擎与编码、预填充、解码分离的并行架构,实现了国产软硬件结合下的推理性能大幅提升,将吞吐成本压低至传统高端英伟达GPU集群的同等水平。

这种工程重构直接反映在价格上。智谱GLM-5.3-Flash的官方定价仅为旗舰版GLM-5.3的十分之一,在限时折扣期间甚至低至二十分之一,仅为Claude Opus 4.8的四十万分之一。

当降价不再是亏本赔本赚吆喝的营销噱头,而是来自于算法优化与硬件架构演进带来的真实成本下降,大模型的价格战才真正具备了商业可持续性。

大模型商业化的快慢分层

在Flash模型铺开之前,行业曾陷入一种思维误区,试图用一个万能的通用大模型解决所有问题。然而,真实商业场景的经济账,彻底打破了这种幻想。

我们将传统全量旗舰模型与现代化Flash模型在核心维度上进行比对。


在参数与算力开销上,传统旗舰模型如Claude Opus 4.8、GPT-5.2全量版或GLM-5.3,单Token激活参数高达几百亿甚至千亿级,属于全算力高耗能;而Flash模型如GLM-5.3-Flash、Qwen3.8-Flash或Gemini Flash,激活参数普遍控制在10B到20B级别,算力开销极低。

在计费单价上,旗舰模型的百万Token成本往往高达数十元至上百元人民币;而Flash模型直接将百万Token价格下探到0.8元至3元人民币区间,甚至更低。在首Token响应延迟上,旗舰模型由于计算密度大,延迟普遍偏高;Flash模型则具备毫秒级响应与超高吞吐的特性。

在适用场景上,旗舰模型擅长处理复杂架构设计、长链逻辑推理与科研突破;Flash模型则精准覆盖智能体路由、高频客服、实时代码补全与文档结构化抽取。

从实际业务需求来看,企业场景中85%以上的日常任务对极致智商的要求并不高,但对响应时延和调用成本极度敏感。

以一个日活跃用户50万的自动化客服智能体为例。若采用传统旗舰模型,单日Token消耗约5亿,按平均每百万Token 30元计算,单日仅API成本就高达15000元,一个月算力开销超过45万元。若切换至阿里云降价后的Qwen3.8-Flash或GLM-5.3-Flash,单日API费用可骤降至1000元人民币以内。

这高达90%以上的成本降幅,直接决定了一个AI应用是做一单亏一单,还是实现盈利运营。

这种经济账上的巨大差异,正在催生大模型生态形成类似人类大脑系统的双核分工。

慢思考系统由旗舰模型担当,保留高单价、低频次调用的特点,充当主控智能体的中央大脑。它不直接干体力活,仅在遇到极其复杂的逻辑卡点、战略规划或长链条错误修正时才被触发。

快思考系统则由Flash模型担当,凭借毫秒级响应、超低单价与超高吞吐量,充当数以万计的子智能体与端侧执行单元。它吞噬全网90%以上的日常Token流量,执行细化的高频任务。

规模崇拜破灭之后的生存法则

国内外巨头集中开卷Flash模型,宣告了大模型产业早期盲目堆叠参数时代的反思。

过去两年,资本市场与科技媒体习惯于将模型参数是否突破千亿或万亿、评测榜单是否夺冠作为评估一家AI公司价值的唯一指标。然而,随着一级市场融资节奏放缓、二级市场对AI概念股审查趋严,市场评估大模型企业的锚点正在发生根本性转移。

未来的行业竞争格局将呈现出清晰的分化。

首先,缺乏底层工程优化能力、仅靠API差价生存的中介套壳商将被加速淘汰。阿里云、智谱等基础设施厂商通过Flash模型将推理成本打入地局,彻底封死了浅层套壳创业者的二次加价空间。应用层企业必须深入到垂直行业的私有数据与工作流闭环中,建立业务护城河。

其次,模型厂商的造血能力将直接取代学术光环,成为生存的死指标。MiniMax 2026年半年报中B端收入703%的增长,以及毛利率从上一年的低位提升至35%以上的财务结果,表明市场只愿意为能够产生明确ROI的工程服务买单。能够用最少资源解出具体场景答案的厂商,才能在未来的现金流长跑中活下来。

大模型向左,继续探索通用人工智能的智力极限;Flash向右,向下扎根进入千行百业的生产线。这并非技术的倒退,而是技术走向成熟、走向大规模商业落地的必经之路。能够算清财务账本、在合理成本内完成高并发交付的AI基础设施,才真正迈过了商业化的生死线。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
《街霸》春丽演员身材练得太夸张!替身要靠臀垫还原

《街霸》春丽演员身材练得太夸张!替身要靠臀垫还原

游民星空
2026-09-10 09:41:10
你的工作要求你对客户隐瞒什么?网友:普通人越早知道越好!

你的工作要求你对客户隐瞒什么?网友:普通人越早知道越好!

另子维爱读史
2026-09-11 22:46:34
一旦武统,解放军将四面受敌,俄媒说句实话:真正的威胁来自内部

一旦武统,解放军将四面受敌,俄媒说句实话:真正的威胁来自内部

補懂事的孩紙
2026-09-12 00:34:10
谢霆锋估计现在心里五味杂陈,他怎么也想不到,王菲在那英的演唱会上,比在自己的演唱会开朗大方多了

谢霆锋估计现在心里五味杂陈,他怎么也想不到,王菲在那英的演唱会上,比在自己的演唱会开朗大方多了

LULU生活家
2026-09-11 20:12:35
抗美援朝最悲情代司令员:首战失利后一生难翻盘,刘帅为之惋惜

抗美援朝最悲情代司令员:首战失利后一生难翻盘,刘帅为之惋惜

老范谈史
2026-09-11 09:32:56
双休购的星星之火已被掐灭

双休购的星星之火已被掐灭

历史总在押韵
2026-09-11 17:11:50
马科斯万万没料到!先来的不是莎拉下台,而是被老杜一家穷追不舍

马科斯万万没料到!先来的不是莎拉下台,而是被老杜一家穷追不舍

仙味少女心
2026-09-10 23:24:31
美国CPI出炉! 美联储下周加息概率升至90% 10年美债逼近5%

美国CPI出炉! 美联储下周加息概率升至90% 10年美债逼近5%

每日经济新闻
2026-09-11 21:16:20
出轨女子第二波聊天记录曝光,虎狼之词惊呆吃瓜网友,她嫌丢人开始批量投诉了

出轨女子第二波聊天记录曝光,虎狼之词惊呆吃瓜网友,她嫌丢人开始批量投诉了

汉史趣闻
2026-09-01 17:55:01
61岁蒋雯丽现状:曾定居英国,如今回国看病,衰老许多不敢认

61岁蒋雯丽现状:曾定居英国,如今回国看病,衰老许多不敢认

动物奇奇怪怪
2026-09-12 00:06:44
易建联:娶巴西足球宝贝荆灵,婚后连生两胎,如今妻儿都定居美国

易建联:娶巴西足球宝贝荆灵,婚后连生两胎,如今妻儿都定居美国

阿废冷眼观察所
2026-09-12 00:48:52
64岁何超琼深圳剪彩,个子不高气场却两米八,背挺得笔直!

64岁何超琼深圳剪彩,个子不高气场却两米八,背挺得笔直!

眼底星碎
2026-09-11 18:19:39
“葫芦娃爷爷”重新挂上7个葫芦,并自制提示牌提醒游客注意安全,游客:爷爷说有人从一千公里外专程赶来,怕大家看不到葫芦会失望

“葫芦娃爷爷”重新挂上7个葫芦,并自制提示牌提醒游客注意安全,游客:爷爷说有人从一千公里外专程赶来,怕大家看不到葫芦会失望

扬子晚报
2026-09-11 21:18:08
丁俊晖:前三局给了威尔逊很大的压力,现在只想赢更多比赛建立信心

丁俊晖:前三局给了威尔逊很大的压力,现在只想赢更多比赛建立信心

世界体坛观察家
2026-09-12 06:09:34
瞒不住了!美军伤亡曝光,是阿富汗的五倍,难怪伊朗一直底气十足

瞒不住了!美军伤亡曝光,是阿富汗的五倍,难怪伊朗一直底气十足

顾蔡卫
2026-09-11 07:14:48
郭德纲再迎噩耗!军媒出手,3句话定死性质,曹云金又扯出旧恩怨

郭德纲再迎噩耗!军媒出手,3句话定死性质,曹云金又扯出旧恩怨

悦君兮君不知
2026-09-11 04:48:31
热搜炸锅!网传宋祖德7月离世却无讣告,深度复盘其跌宕争议人生

热搜炸锅!网传宋祖德7月离世却无讣告,深度复盘其跌宕争议人生

火山詩话
2026-09-12 04:29:49
性专家说:当一个异性开口跟你要钱,要礼物,不管对方是不是想试探你的真心,你都应该明白,你已被对方列入供养者行列

性专家说:当一个异性开口跟你要钱,要礼物,不管对方是不是想试探你的真心,你都应该明白,你已被对方列入供养者行列

心理观察局
2026-08-05 06:46:04
快走少步 vs 慢走多步,哪个更护心?最新顶刊研究:每天这样走30分钟,心血管死亡风险直降47%

快走少步 vs 慢走多步,哪个更护心?最新顶刊研究:每天这样走30分钟,心血管死亡风险直降47%

梅斯医学
2026-09-11 07:53:25
孙千自曝个人账号不更新的原因:我的工作室就是小偷,把我的视频给偷走,不让我自己发

孙千自曝个人账号不更新的原因:我的工作室就是小偷,把我的视频给偷走,不让我自己发

韩小娱
2026-09-11 10:48:44
2026-09-12 06:39:01
钛媒体APP incentive-icons
钛媒体APP
独立财经科技媒体
139304文章数 862580关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

18岁女子加前男友微信被现男友发现 争吵后跳楼身亡

头条要闻

18岁女子加前男友微信被现男友发现 争吵后跳楼身亡

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

女装“玖姿”母公司跨境贸易迷局:安正时尚说谎了吗?

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

旅游
艺术
手机
数码
家居

旅游要闻

研究报告预计:中国入境游未来10年或迎3万亿元市场增量

艺术要闻

《步辇图》最大骗局:全程没有文成公主,却骗了所有中国人 1300 年

手机要闻

豆包手机二代下周发布!努比亚晒NaviX Ultra蓝境配色真机图

数码要闻

无开机广告!哈趣 K3 Ultra Max,高亮哈曼音响畅享大屏观影

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版