网易首页 > 网易号 > 正文 申请入驻

三个月价格腰斩,大模型的“聪明”正在贬值?

0
分享至



大模型肉搏战的另一面。

文|魏琳华

编|刘俊宏

七、八、九三个月,大模型行业像打了鸡血。

从海外“御三家”到国内大模型厂商,轮番发布的新模型让人目不暇接。9月第一周,OpenAI、Anthropic、谷歌你方唱罢我登场,Claude Fable 5.1、Gemini Flash 3.8、GPT-6 Astra先后发布。

国内各种版本的“Flash”模型也在扎堆发布。

继智谱的“牛来”(GLM-5.3-Flash)和阿里Qwen3.8-Flash同天发布后,9月10日,DeepSeek先下架了V4 Pro、并发布V4.1 Flash接棒,把价格再按下一档;月之暗面则交出了一个继K3后版本号倒退的Kimi K2.8 Preview,虽然没有公布具体参数,官方表示,它是一个接近K3性能、效率更高的模型。

各家拿出的模型能力节节攀升,但定价却跑出了完全相反的态势

据Silicon Data的LLM Token支出指数(计算市场每百万大语言模型Token的平均支付价格),8月单月暴跌29%,为0.97美元/百万Token,首次跌破1美元关口。对比今年5月,这个指数还在2美元以上。短短三个月,就经历了一次“腰斩”。



一个“平均支付价格”的下跌,来源最可能是两种解释:要么全行业普降,要么调用结构在集体涌向便宜模型。而在各家大模型API平台用户量水涨船高、Token消耗量暴增的背景下,答案是两者正在同时发生。

AI模型能力在通胀,Token价格在通缩。

这背后是一个增长叙事:只有抢夺足够多的用户,大模型公司才能继续撑起的增长叙事。为此,给模型砍缓存成本、降低定价、推Flash模型,从可选动作变成了大模型厂商的必要手段。

用户正在“用脚投票”,为自己的AI搭子选择更有性价比的模型。

更聪明的模型要便宜,Flash模型成为旗舰替代品

在DeepSeek R1过后,大模型厂商自证身价的路变得更清晰——证明自己的模型有多聪明。跑分榜、刷基准,智力是大家“秀肌肉”的硬通货。

但现在,讨论的风向开始变化。在能力近似的前提下,大家能做到多便宜?性价比正在成为大模型行业新的角力点。

今年5到6月Token支出价格经历的快速回落,就与DeepSeek V4 Pro等国内开源模型的降价相关。

5月,DeepSeek曾宣布将自家模型DeepSeek V4 Pro价格永久下调75%,调整后的价格为输入(缓存命中)0.025元/百万tokens,输出为6元/百万Tokens。虽然8月因为扛不住压力又宣布涨价,但这恰恰说明这轮价格战不是“补贴战”,每一“刀”还得“尊重”成本曲线。

但当开源模型能力比肩其他旗舰模型,价格却打到了旗舰的零头,用户怎么选,不难猜。

对此,高盛One-Delta部门负责人Rich Privorotsky指出,AI大模型已经来到下半场,正在由技术是否可行转向成本是否可承受。

当价格成为用户选择的关键因素,大模型厂商们开始用各种方式把模型价格往下打。

最简单粗暴的方式是直接打价格战,让利给用户。

以OpenAI为例,它先对自家的“小弟”动手,没得到明显反馈后,又把屠刀伸向自家旗舰模型。它先于7月30日宣布GPT-5.6 Luna永久降价80%,同系列的Terra也降价20%。不到一个月的时间,又把自己上个月刚发布的旗舰模型GPT-5.6 Sol输入降价20%,输出降价1/3。



一个月“砍”两刀,从外围砍到旗舰。价格战的烈度,被一级级提高。

另一种方式更隐蔽,比如把API接入自家或者其他编程、办公产品,打个限时5折或是两周免费的优惠,或是直接送额度重置。名义上价格没动,但本质上都是变相打折,吸引用户用自家模型跑任务。

但前两种都只是在价格层面动手脚。更根本的打法,是直接对模型本身动刀。

一方面,是大模型厂商们开始在旗舰模型系列之外,发布各种版本的Flash模型,用接近旗舰的性能、远低于旗舰的定价,成为用户日常办事的主力。

智谱的“牛来”模型GLM-5.3-Flash、阿里的Qwen3.8-Flash、月之暗面的Kimi K2.8 Preview,走的也是同一条路。它们都是在自有的旗舰模型基础上,训练出效率更高、定价更有优势的版本。



比如,Qwen3.8-Flash是一个靠新模型架构降低训练、推理成本的性价比模型,官方指出,它的训练开销仅约为Qwen3.7-Plus的1/9。除了性价比优化之外,它把优势点在了编码和办公场景会用到的代码、Agent等能力上。Kimi K2.8 Preview更直白,从它的名字就能明白,它是一个能力接近K3的模型,但效率提升,本质上也是Flash思路的另一种表达。

做Flash模型,为的不是做个面面俱到的优等生,而是当一个物美价廉的“打工人”。模型可能没那么聪明,但对大多数日常任务来说,“够用”本身就是全部需求。

另一方面,旗舰模型也没能“幸免”。它不仅要智能,还要在智能的前提下尽可能便宜。大模型厂商们开始把优化的刀砍向了旗舰模型本身。

Anthropic和DeepSeek们的选择是输入、输出价格不变,对缓存命中的定价下手。比如9月发布的Claude Fable 5.1,定价依然昂贵,但它把缓存读取从1美元降到0.25美元每百万Token,降幅75%。

为什么缓存的价格能砍得这么狠?

从推理成本来看,大模型推理的大头在Prefill阶段(预填充)。比如一段10万字的文档,模型要先从头到尾过一遍,把每个句子拆解成Token,并行计算所有Token的注意力,并生成KV Cache(键值缓存)存入显存。但缓存读取不一样,如果第二次调用同一个上下文时,就可以直接读取KV Cache,取出来用的边际成本几乎为零。同样的内容,成本却天差地别。

更关键的一点还在于需求侧的变化。

今年应用逐渐成熟的Agent场景,就是缓存读取的大户。一个任务可能反复读取同一个长上下文几十上百次。砍缓存价格,更是相当于直接补贴增长最快的场景。

以DeepSeek V4.1 Flash为例,它通过架构、注意力机制、缓存精度三个维度,把KV缓存的空间大幅压缩,从“源头”降低存储成本。



OpenAI的思路则是压缩输出Token降低成本,通过优化任务输出的Token长度,让同样的任务消耗的Token更少。哪怕API定价本身涨了2.5倍,但单次任务的Token消耗量下来了。这是一个“单价涨、但总价降”的做法。

但这条路线也有极限。在GPT-6 Astra发布后,用户发现以前够用的额度在调用新模型后消失飞快,可见有限的优化也难解用户的“渴”。优化的速度,赶不上模型变强带来的消耗膨胀。

降价、折扣、“Flash省流”、砍缓存、压输出,模型厂商的招式齐出,但目的都是同一件事——让用户舍得花Token,公司才能继续讲增长的故事。

为什么大模型厂商要把价格打下来?

当需求端花不起钱,即使是第一梯队的大模型厂商们,也得考虑怎么给模型降价。

对比Token价格指数曾经的两个高峰来看,它的第一次出现在今年1-2月,OpenClaw的爆发带动AI需求增长,Agent成倍消耗Token的特质,进一步加速Token消耗量翻倍增长,这是一个供需驱动的逻辑;第二次则是出现在5月,Token价格指数摸到了2美元左右的顶点,那是海内外旗舰模型轮番涨价的结果。

彼时,所有人都相信:模型越聪明,就越能拥有定价权。

但作为撑起API消耗的主力军,企业早就无法承受昂贵的Token账单。

以Uber为例,今年4月,这家公司就表示全年的AI工具预算已经全部花完。CTO表示,每名工程师月均API调用成本高达500-2000美元。为了激励员工用AI干活,公司甚至设立了Token排行榜。不加限制地鼓励,最终导致Uber花钱如流水。



比花钱更冤的,是钱花了,还没能“听个响”。

在一档播客上,谈及Uber耗费的Token是否真正转化成了对消费者们有用的功能,Uber COO Andrew Macdonald表示,AI使用量和实际上生产的功能之间很难联系到一起。也就是说,Token本身花得值不值,还没办法确切衡量。

Uber不是个案。Meta、Amazon等企业一开始都鼓励员工消耗Token,排行榜也是司空见惯的手段,但当AI的账单增长速度远超业务价值的增长速度,最后也不得不给员工们设置好单月在Claude Code、Cursor等AI工具的Token上限,让大家“省着花”。

为了压缩AI支出费用,企业们一方面开始给员工限制预算,另一方面,他们开始打起了开源模型的主意。

对于还没上市的OpenAI和Anthropic来说,Token消耗增速是估值故事的核心支柱。当生意开始大幅流向开源模型,自家业务增速放缓,估值就要打折。

闭源API的赚钱逻辑,本质上靠的是前沿模型的定价权。一旦商业空间被压缩,再贵的模型也得放下身段。毕竟,得先有用户,才有未来。这也是为什么两家海外巨头也主动开始考虑起替用户“省钱”的事情。

但需求端想要往下压价格,供给端也得接得住。

厂商之所以敢降价,是因为模型训练的成本结构本身正在被改写——预训练依旧昂贵,但后训练的重要性提升,让大模型厂商们能用更小的模型达到更大模型的效果。

早在2024年,Anthropic CEO Dario Amodei曾预测,2025年-2026年,前沿模型的训练成本将在50亿-100亿美元的范围内。

而在这百亿成本里,芯片占据了支出的大头。

以这次“力大砖飞”的GPT-6 Astra来说,动用了10万张GPU的集群,是OpenAI迄今为止最大的训练规模。按照一块英伟达H100约3万美元的价格计算,10万张GPU的硬件采购成本就要约30亿美元。



无休止堆卡跑预训练是必要的,但也是昂贵的,Scaling Law总是能在恰当的时候“great again”。

但在强化模型能力的战场里,除了预训练,后训练同样能够撬动模型能力的提升,而且成本结构完全不同。

以智谱为例,智谱AI创始人唐杰发文称,在总参数与激活参数不变的前提下,通过加大强化学习和长程任务反馈的投入,GLM-5.3的端到端任务完成率比GLM-5.2提升超50%。智谱还在财报电话会上提出,决定一个模型上限的包括基座规模、有效深度、训练深度、任务环境四个因素。

这句判断提到的后两个要点,几乎都由后训练的投入决定。在这个框架里,预训练决定底子,后训练决定上限。

MiniMax则把后训练的关键进一步引到了推理效率上,在后训练阶段,推理算力的占比越来越高——合成数据的标注是推理,强化学习Rollout是推理,评测本质上还是推理。推理效率本身就决定了模型的研发效率。

MiniMax创始人、董事长兼CEO闫俊杰还给出了一个观点:在相同算力规模下,推理计算效率的提升倍数,与后训练规模的扩大倍数基本线性相关。

需求端的花不起,决定了价格不得不降;后训练带来的能力提升,决定了模型厂商有降价的底气。。

大模型的“杰文斯效应”失效了?

Token支出指数的暴跌,正在打碎“Token经济”的美梦。

在此之前,行业里有一个被反复引用的叙事:杰文斯悖论。

1865年,杰文斯在《煤炭问题》提出一个观察:瓦特蒸汽机把每单位工作的煤耗降了好几倍,但英国的煤炭总消耗量反而暴涨了100倍。效率提升没有让资源用得更少,反而让它用得更多——因为更便宜了,所以用的场景爆炸式增长。

这个叙事被套到Token上,就成了今年开始主流的商业故事:模型越便宜,Token用量越大;用量越大,大模型公司的收入就越高。降价不单纯是为了让利,企业们更希望用它做大整个市场的盘子。

但OpenRouter的8月数据,正在对这个故事打上问号。

据摩根大通的研究,OpenRouter平台8月路由Token量环比增长约47%,但对应的美元支出微增7%。用量狂飙、单价崩塌,支出却几乎原地踏步。

这一点也体现在消耗结构层面。在8月OpenRouter月度Token排名前十的模型里,DeepSeek V4 Flash-0731以50.7万亿Token高居第一。前十名里,低价Flash模型占据了半壁江山。这说明新增的调用,大头流向了最便宜的那批模型。



Privorotsky在报告中戳破了这层窗户纸:“更多需求加上更低价格,若收入增长跟不上成本增长,那对AI基础设施投资来说是个坏消息。”

不过,杰文斯效应短期内的失灵,不代表这个故事彻底破产了。OpenAI GPT-6 Astra的发布,似乎又让行业看到了“智能”领先于“性价比”的苗头。

GPT-6 Astra不仅能直接调用专业软件,将参考图片转化为可编辑交互的工程文件。作为通用模型,它甚至被接到机械手上,用来操控机器完成叠衣服等指令。

这种表现,一定程度上能与拿着合成数据、真实数据训练的具身智能“大脑”相提并论。只是从任务执行流畅性角度来说,GPT-6 Astra还很初级,毕竟它要从视觉反馈画面“现场计算”。但这一事件输出的信号已经足够清晰——通用模型开始长出“手脚”,“干掉”一些需要专门训练的AI。

这条“智能曲线”跟当下的价格战并不矛盾。当智能泛化解锁新场景,新场景带来新的爆发式需求,用量红利才会产生。

所以,Token单价跌破1美元,更像是智能和性价比的一个过渡期。现在,昂贵的模型被性价比挤兑,但模型在更多行业场景的应用空间还未被完全挖掘。从这个角度说,杰文斯悖论并没有完全失效。

Token市场目前的问题在于,新场景的爆发还跟不上价格坍塌的速度。

Agent、企业工作流、个人应用等均处在成长期,它们的应用范围、任务完成度都还有更大的拓展空间。

接下来,谁能吃到增长的红利?

过去,市场认为,智能的定价权牢牢握在模型领先者手里。但当能力差距缩小、工程化的权重越来越大,定价权就开始从“智能领先”,滑向更具“性价比”的公司手里。

这也是为什么中国模型公司在这一轮价格战中格外有存在感。随着中美模型能力差距不断缩小,价格更“香”的开源模型,变得更受市场青睐。

价格的下限还会不断下探,但等到它真正成为“水电煤”的时候,AI应用的故事才真正开始。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“整完容才到普通人水平!”初中女孩晒整容前后对比照,有点心酸

“整完容才到普通人水平!”初中女孩晒整容前后对比照,有点心酸

世界圈
2026-09-14 15:05:05
伊朗队主帅:中国队球风粗野,全力防守一心只想和我们打平

伊朗队主帅:中国队球风粗野,全力防守一心只想和我们打平

林子说事
2026-09-21 17:46:46
驾照一直没扣分的可以乐了!驾驶证连续3年不扣分,有这5种好处

驾照一直没扣分的可以乐了!驾驶证连续3年不扣分,有这5种好处

沙雕小琳琳
2026-09-19 01:47:28
16+512GB 8499 元!vivo 刚发布的 X500 系列太离谱了

16+512GB 8499 元!vivo 刚发布的 X500 系列太离谱了

科技狐
2026-09-22 00:46:57
每体:B席在皇马逐渐失去位置,近5场西甲仅1次首发

每体:B席在皇马逐渐失去位置,近5场西甲仅1次首发

懂球帝
2026-09-21 17:48:05
秋天,打死不要买这3种蔬菜,没营养还会伤身体,菜贩子自己都不吃

秋天,打死不要买这3种蔬菜,没营养还会伤身体,菜贩子自己都不吃

江江食研社
2026-09-21 22:55:06
走心了!江苏一企业给每名员工发26样中秋礼品,不少人开三轮车来拉,礼品既有年轻人爱吃的,也照顾到了老人和小孩

走心了!江苏一企业给每名员工发26样中秋礼品,不少人开三轮车来拉,礼品既有年轻人爱吃的,也照顾到了老人和小孩

王老师你还好吗
2026-09-22 04:22:51
沙特被曝不再参与中国跨境结算平台,利亚德的这步棋还是走短视了

沙特被曝不再参与中国跨境结算平台,利亚德的这步棋还是走短视了

云鹏叙事
2026-09-21 15:15:42
不出意外,F4是彻底结束了。朱孝天在湾区升明月一个人唱《流星雨》

不出意外,F4是彻底结束了。朱孝天在湾区升明月一个人唱《流星雨》

动物奇奇怪怪
2026-09-22 00:04:40
放弃中文名加入日本国籍!带领队伍击败中国队夺冠,已成为心头大患

放弃中文名加入日本国籍!带领队伍击败中国队夺冠,已成为心头大患

浮生若梦w
2026-09-07 08:10:54
湾区升明月翻车现场!一屋子专业歌手,愣是被两个跨界的比下去了

湾区升明月翻车现场!一屋子专业歌手,愣是被两个跨界的比下去了

娱圈办事处
2026-09-21 12:51:26
闲鱼涉黄产业链被曝堪比暗网:标注处宝可约医院认证,最小14岁

闲鱼涉黄产业链被曝堪比暗网:标注处宝可约医院认证,最小14岁

柴狗夫斯基
2026-09-21 11:59:12
马卡:小蜘蛛在马德里德比全情投入,赢得现场大部分球迷掌声

马卡:小蜘蛛在马德里德比全情投入,赢得现场大部分球迷掌声

懂球帝
2026-09-21 15:27:17
宁波西瓜砸人后续:7万赔偿全额到账,摊主手边就有刀,一下没动

宁波西瓜砸人后续:7万赔偿全额到账,摊主手边就有刀,一下没动

江山挥笔
2026-09-20 17:51:24
【油价大降】近1.72元/升,连降三次95汽油跌破“7.7元/升”后,插翅上涨,9月“已接近9元/升”,下次9月24日调价,预涨0.5元/升!

【油价大降】近1.72元/升,连降三次95汽油跌破“7.7元/升”后,插翅上涨,9月“已接近9元/升”,下次9月24日调价,预涨0.5元/升!

猪友巴巴
2026-09-21 14:35:06
理记发长文称罗永浩“保护伞倒了”,所以这次不敢回应

理记发长文称罗永浩“保护伞倒了”,所以这次不敢回应

三言科技
2026-09-21 17:25:36
多兰直言自己跑5公里只要10分钟,网友通过计算,发现他比世界纪录还快

多兰直言自己跑5公里只要10分钟,网友通过计算,发现他比世界纪录还快

新游戏大妹子
2026-09-21 11:15:55
媒体:秦始皇陵水银来源被找到

媒体:秦始皇陵水银来源被找到

澎湃新闻
2026-09-21 09:43:58
表姑向我借了85000元,17年没还,我去银行注销旧卡时,柜员看了眼卡说:女士,最后一笔转账留言您要看吗?

表姑向我借了85000元,17年没还,我去银行注销旧卡时,柜员看了眼卡说:女士,最后一笔转账留言您要看吗?

品读时刻
2026-09-22 09:04:55
我搭伙过3个男人,发现男人过了50岁还找女人,无非就三个原因

我搭伙过3个男人,发现男人过了50岁还找女人,无非就三个原因

千秋文化
2026-07-15 19:53:34
2026-09-22 11:55:00
光锥智能 incentive-icons
光锥智能
来这里,看千行百业的数字化、智能化。
1128文章数 141关注度
往期回顾 全部

科技要闻

Meta智能体爆火!亚马逊却把门关了

头条要闻

媒体:德国选择党再次大胜 留给默茨的时间恐怕不多了

头条要闻

媒体:德国选择党再次大胜 留给默茨的时间恐怕不多了

体育要闻

跟着华裔天才重仓AI,勇士旧将成资本大佬

娱乐要闻

梅艳芳母亲临终决定:与儿子断绝关系

财经要闻

千叶的虚假账面 客户与供应商疑为自己人

汽车要闻

拥抱中国技术与产业链 本田在华开启全新战略

态度原创

艺术
数码
亲子
教育
家居

艺术要闻

27幅 著名油画家 罗工柳作品选

数码要闻

15年老服务器起死回生!大神自制主板塞进树莓派CM5:NVMe+USB3.0全有了

亲子要闻

带孩子旅游,就要去这些地方!

教育要闻

下午18:00截止!注册入学志愿填报入口+流程

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版