网易首页 > 网易号 > 正文 申请入驻

国产大模型,贵到用不起

0
分享至



唯有在技术、价格、稳定性方面,均形成合力,产品才能撑起用户的续费预期

文/林书

最近这一个月,硅谷AI界可谓大招频出,GPT-5.6、fable5、Grok-4.5接连问世。

一时间,国内开发者、程序员群体纷纷沸腾,各种关于GPT-5.6等前沿模型的讨论、测评此起彼伏。

尽管这个月也有Kimi-K3这样的新锐国产模型问世,但总的来看,国产大模型当前在一线开发者群体中,始终处于一种“叫好不叫座”的状态。



根据最新数据,在使用量方面:OpenRouter 6月22日至28日数据显示,中国模型周调用量达20.39万亿Token,美国模型为4.25万亿,前者已连续九周领先。

但与之形成反差的是,国内AI六小龙在营收方面的表现,却不怎么尽如人意:公开财报显示,智谱2025年营收7.24亿元,亏损却达到了30亿元以上,MiniMax为7900万美元(约5.7亿元);月之暗面等其余四家尚未披露完整年营收。

即使头部企业,收入仍停留在数亿元量级。

相较之下,作为AI头部企业的Anthropic,其ARR已经达到了约 600 亿—700 亿美元,主要驱动力为 B2B API 及 AI Coding 场景 。

这不由得引出了一个尖锐的问题:

为何号称“便宜”、“调用量大”的国产模型,至今仍然叫好不叫座,在AI Coding等高价值的场景上,至今仍难以与国外顶尖模型正面抗衡?

最近,笔者在与多个一线开发者深入探讨此问题后,发现了一个很反直觉的事实:

国产大模型,某种程度上其实非常“贵”。

也正是这样的“贵”,让某些性能上有所突破的国产模型,难以真正展现自己的闪光之处。

01

“低价”的幻觉

提起国产大模型,很多人想到的都是DeepSeek、Kimi、智谱这样的代表,而与之关联最紧密的标签之一,就是低价、便宜;

如果仅从Token单价上来看,国产模型与GPT-5.6、fable5等顶尖模型相比,确实有着不小的优势,拿GLM-5.2与DeepSeek V4举例:GLM-5.2每百万Token输入/输出为1.4/4.4美元,DeepSeek-V4-Pro为0.435/0.87美元;GPT-5.6 Sol为5/30美元,Claude Fable 5则为10/50美元。

但实际上,这种“低价”的印象,是一种圈外人长久的误区。

尤其在高强度的编程场景下,国产大模型的单价不但没有优势,甚至反而还比有套餐的GPT、Claude贵出好几倍。

李光(化名)是AI领域的一位科研工作者,由于工作需要,每天都要在AI Coding的场景下消耗几十亿Token,在这样的消耗量下,如果用国产大模型,例如GLM-5.2,整体的成本就会变得非常恐怖。



李光晒出的Token账单

在交谈当天,李光消耗的Token已经接近40亿,这里可以稍微换算一下,倘若他用的是GLM-5.2,成本大致是:(8639万普通输入×1.4美元+33.80亿缓存输入×0.26美元+1906万输出及推理×4.4美元)约为1084美元,按1美元兑7.2元估算,约合人民币7800元。

而让李光如此放开手脚烧Token的原因,就是因为他开了GPT的CodeX套餐,

这里简单解释一下CodeX套餐的具体形式,简单来说,它是针对编程场景推出的一款套餐:严格说来,它并非真正不限量,而是把Codex纳入ChatGPT订阅:Plus为20美元/月,Pro从100美元/月起,额度约为Plus的5倍或20倍;触顶后可购买Credits继续使用。

同样地,Anthropic的Claude Code也有一套类似的套餐,具体形式是:Claude Pro为20美元/月,Max 5x和Max 20x分别为100、200美元/月;Claude网页端与Claude Code共享每5小时及每周额度,触顶后可按API价格续用。

在这样的套餐兜底下,巨大的Token成本反而被抹平了。

对于国内的开发者来说,在高强度AI Coding场景下,每天消耗几十亿、上百亿Token,是一个很普遍的常态。

小刘也是一个AI Coding的重度开发者,他在Codex上实际一周的花费是 300元人民币,而这还是在没有公司报销的情况下。

但即使是这样的成本,对比国产模型,依然显得“便宜”了很多,因为同样300元,根本买不来GLM 5.2 同等数量的token。



小刘的Token账单

在国内开发者看来,GPT的 codex 套餐,是目前能买到的最便宜的 token,比智谱、kimi 便宜好几倍,这可能反直觉,但是事实就是国产模型在高强度的Coding场景下,性价比完全无法与之对比。

这里需要说明的是:codex并非真正意义的不限量套餐,如果按最高档200美元算,一周大概有20亿额度。

但是,由于部分开发者会通过“中转站”等手段使用模型,某些模型的实际成本,会比官方渠道低很多,这就导致有时能以更低的价格,买到更多Token,于是才有了300块能买120亿Token的现象。

实际上,国产模型在定价方面,不是没有推出过类似的套餐,但如果细究起来,这样的套餐,在限额方面,比起codex而言,存在着很大的限制。

02

国产定价之痛

国产大模型在定价方面的现状,可以用一句话来形容:

“你以为你进的是自助餐的场子,但最后发现,商家还是按斤计费。”

举例来说,在套餐方面,国内的Kimi、GLM-5.2:Kimi Code分为49、99、199、699元四档,额度按周刷新;GLM Coding Plan的Lite、Pro、Max每5小时分别约80、400、1600次Prompt,每周约400、2000、8000次,且GLM-5.2高峰期按3倍扣额。

以阿里的qoder为例,根据笔者一位从事B端客户运维的朋友阿迷(化名)介绍:“qoder曾经是国内最好用的AI IDE,可惜它自己的新定价,把优势搞没了。”

在套餐方面:Qoder CN个人Pro、Pro+分别为59、169元/月,含2000、6000 Credits;Teams与VPC版分别为99、199元/席位·月,均含3000 Credits,后者50席起售。

“今年他们合并灵码调了定价后,就我知道的,至少都有二三十家放弃续费了。”阿迷后来介绍道。

根据阿迷的测试,qoder企业版199的套餐,按他的用法,3天就没了,如果按重度开发者的用法,估计一天就没了。

同样地,在套餐方面,令国内用户感到五味陈杂的,还有GLM-5.2。

按照开发者小薇的说法:“GLM-5.2的套餐约等于没有,就算有套餐高峰期仍然限流,并且还存在‘背刺’用户的现象。”

按照36氪的报道:GLM-5.2的套餐,之前比演唱会门票还难抢,每天早上十点钟准时刷新,能不能买到全凭手速。

2026 年 1 月,智谱发公告说因为算力紧张,把每日可销售量直接砍到原来的 20%,每天早上 10 点放一点额度,几分钟就售罄。

说到底,国产模型在套餐、价格上的“吝啬”,本质上是算力不足造成的窘迫。

根据2025年中国信通院、工信部的数据,中国现存的数据中心是449 个,而美国则是5427 个,在总算力方面,中国为1053 EFLOPS,而美国则是2400。

但这里的关键在于:美国那2,400 EFLOPS 里,高端 GPU 占比极高;中国的算力里,大量是华为昇腾、寒武纪等国产芯片,单卡性能与 H100 仍有代差。

为应对愈发高涨的算力需求,2026 年 3 月开始,智谱、阿里云、腾讯云、百度在Token价格上集体涨价,涨幅从 5% 到 460% 不等。

说白了,国产模型的“低价”、“价格战”早已成为了过去式。

不是国产模型不想搞buffet,是因为算过账:以现在的算力成本和亏损状态,搞包月等于拿固定月费去赌用户不会刷爆,而按照国内开发者、程序员动辄一天烧几十亿、甚至上百亿Token的用法,这样的商业模式,很快会被击穿成本线。

而OpenAI 和 Anthropic 的编程套餐,卖的是高净值企业客户——Cursor、GitHub Copilot 这种大客户一年能给 Anthropic 贡献 14 亿美元收入。

在高算力的加持下,这套商业模式,本质是用"固定月费"换"长期锁客",客户质量高,ARPU 也相对较高,摊得平成本。

而相较之下,国内虽然有阿里这样的云巨头,但问题是:阿里云FY2026 调整后 EBITA Margin 只有 7.5%,云智能集团虽然收入增长快,但利润并不丰厚。

并且,传统云厂商敢卖"不限量云服务器",是因为用户不是 24 小时满负载。一台 ECS,实际 CPU 利用率可能只有 10%,云厂商可以把一台物理机超卖给十个人。

但大模型推理不一样:来一个token,就要实打实烧一次 GPU 算力。用户如果 24 小时不间断刷,云厂商的 HBM 显存、GPU 核心、电费全是刚性支出,没有任何超卖空间。

03

模型的“黄金三角”

除了价格方面的因素外,对国内开发者来说,选择Codex、Calude Code的原因,无疑是其强大的编程性能。

然而,在性能方面,国产模型也并非像某些刻板印象中想的那样。

在与多个开发者交谈后,笔者发现一个较为普遍的观点是:国产大模型,尤其是GLM-5.2等最新的模型,已经可以承接一些辅助性的、次要的任务,例如做测试和修改bug。

但在较为复杂的、长时间的异步任务上,国产模型目前与GPT、Calude等顶尖模型,仍有较大差距。

开发者小张,今年3月份用过一次国产模型编程,用GLM、qwen和GPT对比同样的任务,只有gpt跑完了,且符合页面要求,那是一个多级、多列内容比对和结果生成的项目。

而另一个开发者小薇则表示,根据她的体验,Kimi 2.7 和 豆包 2.1 Pro 性能也尚可,但是它总的来说还是要弱一档(属于第二梯队),但总体而言也超过 Claude Sonnet 4.6 了。

目前,开发者群体中的普遍共识是:GLM-5.2是第一个达到了 Opus 级别的国产模型。

它在执行真实的、复杂的、长时间的异步任务中,它是可用的、占据了一席之地的。

尽管在很多维度,例如世界知识上,其与真正的Opus模型仍有较大差距,但这不妨碍其成为国产模型的新高度。

但现实是:这刚刚崭露头角少数“尖子生”,却被与性能无关的其他因素拖累了。

具体来说,这样的因素包括了缓存效率不高、高峰期仍然会限流等等,让开发者的实际体验很糟糕。

这就引出了当下模型对比中的另一个维度:稳定性。

在一线开发者、程序员的体验中,模型的选择,早已不是简单的性能对比,而是——

性能—价格—稳定性的“黄金三角”。

在这三个维度中,国产模型只勉强拿下了第一维度的部分指标。

近期,国内的Kimi发布了其最新的旗舰模型K3:这是一款拥有2.8万亿参数、原生多模态和100万Token上下文的开放权重旗舰模型,主攻长程编程、知识工作与深度推理。



在众多测评中,其在Artificial Analysis上的智力指数是57分、位列全球第三;Arena前端编程榜以1679分登顶,甚至有传言称,其性能已经能比肩Claude Fable 5。

然而,在耀眼的分数与排名背后,开发者关切最多的,仍然是一个词:性价比。

在K3发布后,很多开发者表示,现在Kimi仍然很贵,与Codex相比没有性价比,且额度不够用,单看API价格,K3也谈不上“白菜价”:每百万Token缓存/输入/输出分别为2/20/100元;GPT-5.6 Sol为0.5/5/30美元,K3虽低于Sol,却明显高于GPT-5.6 Luna的0.1/1/6美元。

且在使用K3的过程中,开发者表示还出现了API断连,甚至断了一上午的情况。

就目前的情况来看,国内开发者不是不愿意为国产模型付费,而是国产模型目前因算力紧、成本高,目前开不起Codex这样具有性价比的套餐,只能开看似自助餐,实则限量的“大众点评套餐”(类似智谱 的Coding Plan)。

而套餐的体验不稳定、性价比模糊,导致用户使用过难以留存。这本质上,是在目前算力底座成本高的情况下,用户的理性选择。

以上这些,并非我们要长他人志气,灭自己威风,只是想提示一种风险。

目前,国产模型在追赶GPT、Claude的路途中,非常喜欢强调性能,但国产大模型从研发到应用,需要攀登的,远不止性能这一座高山。

我们需要的是等待,等到国产算力基座大规模量产了,在技术、价格、稳定性方面,形成合力了,我们的产品就能撑起用户的期待。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
汤家凤项立刚完败!梳理全网反对英语主科的理由,全都没有说服力

汤家凤项立刚完败!梳理全网反对英语主科的理由,全都没有说服力

读鬼笔记
2026-09-16 15:42:45
女生称同济大学痛经请假需脱裤检查,校方:必要时会做妇科检查,判断是否处于经期及是否有其他妇科疾病,若痛经到无法下床可开1至2天假条

女生称同济大学痛经请假需脱裤检查,校方:必要时会做妇科检查,判断是否处于经期及是否有其他妇科疾病,若痛经到无法下床可开1至2天假条

三湘都市报
2026-09-17 17:58:44
密密麻麻!33岁女子体内取出197枚,医生:从医以来第一次见

密密麻麻!33岁女子体内取出197枚,医生:从医以来第一次见

极目新闻
2026-09-17 00:37:11
中方向全球表明红线:只要日方触碰红线,我方可直接对日本动武?

中方向全球表明红线:只要日方触碰红线,我方可直接对日本动武?

蜉蝣说
2026-09-16 11:58:02
孩子父亲回应“2岁幼童从18楼坠亡”:妻子想不通需宣泄,我们的关系没那么“恼火”

孩子父亲回应“2岁幼童从18楼坠亡”:妻子想不通需宣泄,我们的关系没那么“恼火”

红星新闻
2026-09-17 16:18:34
拉合尔倒计时:1965年,当全世界断定巴基斯坦必亡,北京按下另一块棋盘

拉合尔倒计时:1965年,当全世界断定巴基斯坦必亡,北京按下另一块棋盘

南冥那只猫
2026-08-28 23:02:15
台湾"保留军队、制度不变"这两个条件,其实是大陆40年前先提的

台湾"保留军队、制度不变"这两个条件,其实是大陆40年前先提的

麓谷隐士
2026-09-16 00:10:03
全球首个!一针1800万,打一针管一辈子

全球首个!一针1800万,打一针管一辈子

怪味历史连连看
2026-07-22 15:34:32
绿营议员暗酸李四川只会做工,侯友宜妙回:等他胜选可以当面质询

绿营议员暗酸李四川只会做工,侯友宜妙回:等他胜选可以当面质询

吃货的分享
2026-09-18 00:05:06
上调通知晚了点,养老金会从1月1日开始补吗?

上调通知晚了点,养老金会从1月1日开始补吗?

白昼说故事
2026-09-16 17:37:22
佛祖最疼的3大生肖女,第2名福气不断,看看有你吗

佛祖最疼的3大生肖女,第2名福气不断,看看有你吗

考古小铲子
2026-09-07 12:15:55
1982年,邝美云被“赌王”看中,问她:“你愿不愿意做我的太太”

1982年,邝美云被“赌王”看中,问她:“你愿不愿意做我的太太”

疯狂的小历史
2026-09-15 10:01:02
全网都在笑沙特军队拉胯,他们不知道,这正是沙特王室最想要的

全网都在笑沙特军队拉胯,他们不知道,这正是沙特王室最想要的

墨策史
2026-09-16 21:07:31
韩乔生:我们也都“硬着头皮”承办过U20女足赛事,从没有这般糊弄

韩乔生:我们也都“硬着头皮”承办过U20女足赛事,从没有这般糊弄

懂球帝
2026-09-17 20:20:04
孙悦谈05年男篮98-10沙特:尤纳斯要求死命防 唐正东2罚全丢被骂

孙悦谈05年男篮98-10沙特:尤纳斯要求死命防 唐正东2罚全丢被骂

狼叔评论
2026-09-17 01:32:05
范志毅前妻李倩现状:英国再婚生俩混血儿子,女儿跨国探望

范志毅前妻李倩现状:英国再婚生俩混血儿子,女儿跨国探望

南万说娱26
2026-09-15 08:58:45
30分钟,“天地板”后又“地天板”!603159,巨震!

30分钟,“天地板”后又“地天板”!603159,巨震!

证券时报
2026-09-17 16:24:06
“吃这些,你儿子都长不到一米六!”女子自我感动晒早餐,看的人眼前一黑!

“吃这些,你儿子都长不到一米六!”女子自我感动晒早餐,看的人眼前一黑!

林林先生
2026-09-13 11:30:08
打赏陪睡案女主播合租室友发声:魏莹每月陪睡一两次,枕头没干过,经常哭到缺氧

打赏陪睡案女主播合租室友发声:魏莹每月陪睡一两次,枕头没干过,经常哭到缺氧

世界圈
2026-08-24 20:54:42
张本智和:我要拿男单男团金牌!未来10年与松岛辉空包揽世界前二

张本智和:我要拿男单男团金牌!未来10年与松岛辉空包揽世界前二

念洲
2026-09-17 15:46:53
2026-09-18 01:32:49
最话Funtalk
最话Funtalk
不写平庸的故事
654文章数 603关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

猛士X700内饰公布 打造家庭泛越野智能座舱

态度原创

亲子
艺术
健康
手机
教育

亲子要闻

性生活不爽?可能是这些细节没做好

艺术要闻

海因里希·伯默:德国写实风景画家

剧烈头痛伴呕吐,警惕脑动脉瘤破裂

手机要闻

鸿蒙7花粉Beta版有惊喜,华为Mate 60系列手机升级后新增支持眼动翻页功能

教育要闻

都叫七中不是一所学校成都家长最容易认错的集团校一篇分清

无障碍浏览 进入关怀版