网易首页 > 网易号 > 正文 申请入驻

每1美元,中国AI给你115万个token,美国只给3万个

0
分享至

作者:快思慢想研究院 田丰,Global Times 张蔚蓝

引言


今年6月,美国AI创业公司Lindy的CEO做了一个决定:把公司所有流量从Anthropic的Claude切换到DeepSeek。他对外界的解释简洁到近乎粗暴——"接下来几个月,这个决定将为我们节省数百万美元。"

这不是一次情绪化的叛逃,而是一道纯粹的算术题。

用1美元,调用DeepSeek V4-Pro可以生成115万个输出token;同样的钱,在Anthropic Claude Opus 4.8上只能买到4万个token,在OpenAI GPT-5.5上只能买到3.3万个。价差,是28到34倍。


Lindy不是孤例。OpenRouter是全球最大的AI模型聚合路由平台,开发者在这里可以同时接入400余款模型、自由切换。它的流量数据,是目前观察全球开发者真实选择的最直接窗口。数据显示,自今年2月8日起,美国企业通过OpenRouter调用中国AI模型的token占比,每周均超过30%,峰值达到46%。而过去12个月的均值不过11%,2025年上半年更低至4.5%。

18个月,从4.5%到46%。硅谷的开发者正在用每一次API调用投票。

一、架构重塑成本:V4将推理算力需求打到V3.2的27%


经济学中,价格是成本的镜像。要理解中国AI模型为何能定出10倍乃至34倍于对手的价格差距,必须从成本结构的源头读起。

成本结构来自算法架构,这是第一性原理。

2026年4月24日,DeepSeek发布V4系列,分为V4-Pro和V4-Flash两个变体。V4-Pro总参数量1.6万亿,但每次推理仅激活490亿参数;V4-Flash总参数量2840亿,激活130亿。两款模型均以MIT协议开源,原生支持100万token上下文窗口。这个"激活参数"的概念,是理解中国AI成本优势的关键钥匙。

传统稠密模型(Dense Model)的计算方式,好比一家工厂接到每一份订单都要开动全部生产线——无论任务大小,全体员工到岗。MoE(混合专家)架构的革新在于:针对不同任务动态路由、仅激活最相关的"专家子网络"。V4-Pro的1.6万亿参数是全厂总产能,但每次生产只调用490亿参数的精锐小组,计算效率与一款单独训练的490亿参数稠密模型相当,却同时保有万亿级参数带来的深度知识储备。

但V4真正的架构突破,在注意力机制层面的再一次革命。

V3系列使用的MLA(多头潜在注意力)已是业界领先的KV缓存压缩技术。V4在此基础上引入混合注意力架构,融合CSA(压缩稀疏注意力)与HCA(重度压缩注意力):CSA通过可学习稀疏模式处理长程token之间的关联选择,HCA对本地窗口缓存做极端秩压缩。效果直接写进了技术报告:在100万token的上下文场景下,V4-Pro所需的单token推理FLOPs仅为V3.2的27%,KV缓存降至10%;V4-Flash更极端,FLOPs压至10%,KV缓存降至7%。


这是什么概念?同等的推理算力投入,V4-Pro服务的token吞吐量相当于V3.2的近四倍。不是升级了服务器,是把同一台机器的产出效率扩大了四倍。

DeepSeek在V4技术报告中同时披露,V4训练语料超过32万亿token,引入了Manifold-Constrained Hyper-Connections(mHC)替代传统残差连接,强化超大规模训练中的信号传播稳定性;Muon优化器用于加速收敛;MoE专家权重采用FP4量化感知训练,进一步压缩内存与计算开销。

有一点值得坦诚说明:与V3技术报告完整披露训练成本(2.788M H800 GPU小时、约556万美元,对比GPT-4估计超1亿美元)不同,V4技术报告未公开训练总算力消耗与成本数字。DeepSeek仅披露了架构设计与推理效率数据。但逻辑闭环仍然成立:推理侧的算力需求已从技术报告中得到量化验证——百万token上下文的推理成本降至V3.2的约四分之一,这是新一代注意力架构带来的确定性成本坍塌。

这里还有一个不可忽略的背景:美国对华芯片出口管制,限制了中国AI实验室获取最先进GPU的渠道,客观上倒逼中国团队在算法效率上加倍投入。MoE架构、多头潜在注意力、FP8混合精度训练——这些技术路线的持续深耕,从某种意义上是在算力约束下磨砺出来的刀法。限制造就了专注,专注产生了降本的边际效率,而这种效率最终反哺为全球开发者可感知的价格优势。

芯片侧还有一个信号,战略意义甚至超过算法本身。V4是第一款深度适配华为昇腾AI芯片(Ascend 910B与950系列)、使用CANN开源软件栈(算子库、通信库)的前沿级开源模型,训练与推理均可在非NVIDIA硬件上完成。在华为昇腾950DT平台实测数据中,V4-Pro高并发推理吞吐量为每秒388 token,延迟约20毫秒;V4-Flash则达每秒4722 token。英伟达CEO黄仁勋在V4发布前8天接受播客采访时曾表示,"DeepSeek先于英伟达在华为芯片上跑起来"是他不愿看到的结局。8天后,V4发布,他所担心的事情成真了。

斯坦福2026年AI Index报告提供了最直接的宏观坐标:美中两国最强模型之间的能力差距,已从2023年5月的17.5至31.6个百分点收窄至2026年3月的2.7%,而美国的私募AI投资是中国的23倍(2859亿美元对124亿美元)。报告的结论一针见血:美国走的是"以资本换能力"路线,中国走的是"以效率换能力"路线。

快思慢想研究院的判断是,MoE稀疏激活体系每一代迭代(V2→V3→V4)的效率增益呈非线性累积。这是架构红利的复利效应,不是一次性技术突破——每部署一个token,边际成本差距就被复现一次。

二、开源是国家战略,不是慈善:定价目标的根本切换


价格背后是定价目标,定价目标背后是商业逻辑。

Anthropic在2026年5月完成H轮融资,估值攀至9650亿美元;OpenAI最新估值为8520亿美元,均已备案IPO。这两家公司的高API定价,承担着多重不可回避的结构性成本:推理成本占生产AI系统总预算的80%至90%,闭源模型还需叠加安全对齐研发的持续投入、企业服务基础设施的搭建,以及对规模空前的外部投资人的回报承诺。接近万亿美元的估值是一把双刃剑——它代表市场信心,也锁定了高定价的必要性。

中国模型的开源策略,彻底解构了这一套定价方程。

以DeepSeek V4-Flash为例,其API输入定价仅为每百万token $0.14、输出$0.28。V4-Pro更设计了一项专门针对Agent工作流的定价机制:缓存命中时的输入价格降至每百万token $0.003625,相对标准输入价格折扣达120倍。开放权重意味着开发者可自行下载并在本地硬件上运行,发布方无需为每一次调用收取边际利润,收入目标从"单次API的定价权"切换为"通过生态扩散建立分发护城河,再从云服务或企业定制中间接变现"。


这一策略的市场渗透效果已可量化。2026年2月,Alibaba的Qwen单月下载量达1.536亿次,超过Meta、DeepSeek、OpenAI、Mistral等后八名的总和。Qwen在Hugging Face上拥有超过18万个衍生模型,数量超过Google和Meta的总和。斯坦福、UC Berkeley的研究人员以低至30至50美元的成本基于Qwen训练出了表现领先的专用模型。新加坡政府选择了Qwen而非Meta的Llama,作为构建本国主权AI模型的基础底座。

斯坦福2026年AI Index的另一项数据提供了更深层的佐证:全球100篇最高引用AI论文中,中国机构的贡献已从2021年的33篇增长至2024年的41篇。这说明这场成本革命的底层,有一个充沛的技术研究储备在持续供给。

推动美国企业转向的,除了成本,还有另一股力量:美国国内对头部AI模型的监管审查正在收紧。合规压力、数据主权争议与模型使用条款的不确定性,催促部分海外企业主动寻找替代方案。中国开源模型恰好在这一节点提供了在本地部署、自主可控、成本更低的完整选项——这三个属性的组合,在企业级采购决策中具有较强说服力。

Andreessen Horowitz合伙人Martin Casado给出的数据,让硅谷内部感到不安:使用开源技术栈的AI创业公司中,约80%正在运行中国模型。

快思慢想研究院的判断是,中国主流AI实验室没有AppStore式封闭生态需要保护,反而得以用开源换市场份额而无历史包袱。开源是将成本优势转化为分发优势的战略乘数——这一策略已将竞争压力反向传导至OpenAI,促使其发布了自己的开源模型gpt-oss。市场的逻辑一旦成立,就有自我强化的能力。

三、Agent时代改变了一切:价差从"折扣"变成"生死线"


成本差距并非2026年才出现,却在这一年初突然成为市场的决定性变量。触发点是计算范式的切换。

英伟达CEO黄仁勋在多个场合强调,token是AI时代的货币,生产和消费token将驱动AI经济的未来。这句话在2026年初被Agent浪潮赋予了新的分量。

AI的工作方式正在发生根本改变。一次普通对话,模型响应一次;一个Agent任务——让AI自动规划、编写、测试、修正一段代码,或者自主完成一项研究——模型需要被反复调用数十乃至数百次。OpenRouter的实测数据显示,Agentic工作负载每次请求消耗的token量约是普通人机对话的15倍。编程类任务在OpenRouter平台的占比从2025年初的11%跃升至2026年中的50%以上,Agent驱动的输出token已占平台总量的多数——而这一爆发式增长集中在2026年2月之后。

这一转变,让原本可以被品牌溢价覆盖的价格差距,变成了直接穿透月度研发预算的硬约束。


以一项标准化编程工作负载为基准:同等任务在DeepSeek上耗费1071美元,在Claude上耗费4811美元,差距约4.5倍。单次调用的成本差距可能只是财务报表上的一个小数点,但在每日自动化调用数千次的Agent工作流下,这个差距直接决定了一家创业公司的技术路线是否在经济上可持续。这是Lindy做出决定的真实逻辑——他们切换的不是品牌偏好,是生存必选项。

值得关注的是,这种成本压力在不同行业的传导方式并不相同。资深电信产业观察者向锂光指出,AI落地的最后一公里是推理,而推理环节的token消耗才是真正的成本核心。对于很多实际场景——自动驾驶的实时感知决策、医疗问诊的高频辅助、家用机器人的指令响应——业务需要的不是最贵的旗舰模型,而是在足够的精度下以最低成本持续运行的推理能力。DeepSeek、智谱AI、阿里Qwen等中国厂商恰恰在架构优化、token效率与更智能的推理策略上持续投入,在单位算力产出上具备系统性优势,这使其在高频、长尾、对成本极度敏感的企业应用场景中,成为优先入选项而非将就之选。

更值得关注的是机构客户的行为迁移。OpenRouter数据显示,包括AI原生公司和大型组织在内的企业级用户,在2026年6月初向DeepSeek路由的token流量远超年初水平。这说明主动转向中国模型的,不只是预算有限的初创团队,具有真实议价能力的机构客户也在做出同样选择。

智谱AI的GLM 5.2提供了另一个维度的例证:在一项主流Agent基准测试中,GLM 5.2的得分与Anthropic Opus 4.8相差不足1%,但使用成本仅为后者的五分之一。这已经不是"便宜但将就"的逻辑,而是"同等能力、更低成本"的竞争格局——“智价比”正在成为企业级采购的首要筛选条件。

V4-Pro的缓存命中定价印证了这一取向:每百万输入token $0.003625,是标准输入价格的1/120。这一机制专门面向Agent工作流的结构性特征而设计——稳定的系统提示和RAG上下文在多轮调用中被反复使用,缓存折扣在高频Agent场景下的实际节省幅度,远超表面价差所展示的数字。

快思慢想研究院将这一现象归结为两种"token经济"模式的并存:一种以约束下的效率最大化为核心,另一种以稀缺性溢价为定价基础。Agentic范式下,两种路径的市场反馈周期极短:每日数千次的自动化调用让成本差距从"百分比折扣"变成了"技术路线可行性门槛",而非一个可以被品牌溢价从容覆盖的次要因素。

四、三条线索,一个结论


从架构到生态,从代码到商业,这三条线索汇集成一个结论:

中国AI大模型在MoE稀疏激活架构持续迭代、开源扩散战略重构定价逻辑、Agentic工作负载放大成本差距三重叠加下,系统性压低了推理侧边际成本,并在Agent计算范式转移的节点,将价格差距转化为了市场份额的决定性优势。

"AI市场正在从模型最强的可选项,转向更具成本效益、更易部署的必选项。"这是开发者用脚投票、用流量数据写下的事实。


46%——这个在OpenRouter上峰值出现过的数字,可能只是个开始。

参考文章:《US firms’ growing adoption highlights rising competitiveness of Chines AI models: experts》,Global Times,Zhang Weilan.


畅销书:《AI商业进化论:“人工智能+”赋能新质生产力发展》

出版社:人民邮电出版社

作者:田丰

帮助你定位AI当下发展坐标的指南针

帮助你洞察AI未来演进趋势的航海图

通俗化解读AI的原理、特性和四大发展规律、提供AI赋能商业、引发新质生产力变革的一手案例分析。既有宏观视角的全局观照,又有各行业应用层面的下探记录,聚焦AI的原理与实践、现在与未来,是当下AI应用的全景图、更是身处AI技术浪潮之中的探路书。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
亚洲4队冰火两重天!朝鲜提前晋级,中、日接近出线,韩国已命悬一线

亚洲4队冰火两重天!朝鲜提前晋级,中、日接近出线,韩国已命悬一线

绿茵舞着
2026-09-11 23:46:10
网传北大张丹丹被免职,评论区炸锅,一片叫好声…

网传北大张丹丹被免职,评论区炸锅,一片叫好声…

慧翔百科
2026-09-10 12:19:31
简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

步论天下事
2026-09-07 09:40:52
人有本事,一眼便知:有本事的人,都有4个特征,遇见要深交

人有本事,一眼便知:有本事的人,都有4个特征,遇见要深交

金沛的国学笔记
2026-09-10 16:42:52
第二个菲律宾出现?主动邀请美国重启军演,中方近70年友谊喂了狗

第二个菲律宾出现?主动邀请美国重启军演,中方近70年友谊喂了狗

真的好爱你
2026-09-10 18:48:38
交涉失败,欧洲议会保台当局参会,大陆已下通牒,事态严重了

交涉失败,欧洲议会保台当局参会,大陆已下通牒,事态严重了

新一说史
2026-09-12 05:10:05
50岁李小冉自曝离婚后真实处境:父母身体不好,一个人住,庆幸身边还有朋友

50岁李小冉自曝离婚后真实处境:父母身体不好,一个人住,庆幸身边还有朋友

动物奇奇怪怪
2026-09-12 09:51:47
招行退休多年的高管突然被查、年薪曾达500万,田惠宇之后3位副行长相继落马

招行退休多年的高管突然被查、年薪曾达500万,田惠宇之后3位副行长相继落马

湘财Plus
2026-09-11 19:45:47
湖南满族人宋剑仁,因煽动民族仇恨民族歧视被判刑三年半

湖南满族人宋剑仁,因煽动民族仇恨民族歧视被判刑三年半

张可象
2026-09-11 14:05:48
“摊上这种同学,家长肯定要调班!”狼尾小学生火了,毛病太多被喷

“摊上这种同学,家长肯定要调班!”狼尾小学生火了,毛病太多被喷

妍妍教育日记
2026-09-11 15:13:18
1500亿的鲍尔默彻底怒了!硬刚萧华,直接把伦纳德事件闹进司法部

1500亿的鲍尔默彻底怒了!硬刚萧华,直接把伦纳德事件闹进司法部

篮球小布丁
2026-09-12 02:44:24
美股科技巨头暴涨近12%创新高,市值一夜飙升2500亿元

美股科技巨头暴涨近12%创新高,市值一夜飙升2500亿元

21世纪经济报道
2026-09-12 08:29:45
绿军交易方案:拿下2.17亿三届全明星,保罗乔治成为重要交易筹码

绿军交易方案:拿下2.17亿三届全明星,保罗乔治成为重要交易筹码

夜白侃球
2026-09-11 11:48:11
美媒:万斯为特朗普“每个选民发5000美元”许诺辩护,被猛烈抨击

美媒:万斯为特朗普“每个选民发5000美元”许诺辩护,被猛烈抨击

环球网资讯
2026-09-11 12:00:31
“典型的上梁不正下梁歪!”家长发视频炫耀,家里没有一个正常人!

“典型的上梁不正下梁歪!”家长发视频炫耀,家里没有一个正常人!

林林先生
2026-08-29 10:51:30
注意!商业地产到期需补缴巨款!

注意!商业地产到期需补缴巨款!

樱桃大房子
2026-09-09 12:12:20
如何判断领导值得跟随?网友:年轻女领导中年男领导待退休老领导

如何判断领导值得跟随?网友:年轻女领导中年男领导待退休老领导

夜深爱杂谈
2026-09-11 22:51:07
湖人消息:佩总操作封神,人事变动官宣,两将离队在即

湖人消息:佩总操作封神,人事变动官宣,两将离队在即

冷月小风风
2026-09-12 10:55:54
魔幻!13年前围堵法布雷加斯的4位曼城大将,如今齐聚欧冠教练席

魔幻!13年前围堵法布雷加斯的4位曼城大将,如今齐聚欧冠教练席

体坛老球迷
2026-09-11 10:27:11
方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

八卦王者
2026-09-09 14:23:41
2026-09-12 11:40:50
田丰说 incentive-icons
田丰说
阅读养成远见,超越你所未见
99文章数 7关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

上海7岁女童遭搅拌车辗轧双腿高位截肢 奶奶当场死亡

头条要闻

上海7岁女童遭搅拌车辗轧双腿高位截肢 奶奶当场死亡

体育要闻

老鹰真正的底气来自于什么?

娱乐要闻

港媒曝钟丽淇疑患渐冻症,本人发文

财经要闻

继房子茅台之后 中产的第"神话"也破灭了

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

艺术
家居
游戏
旅游
公开课

艺术要闻

18幅 萨夫拉索夫 风景油画

家居要闻

2026建博会(广州) 公装联探展交流活动

《塞尔达传说》新作实体封面曝光!背面超帅 顶尖设计

旅游要闻

出游火热却赚钱难?这场智库圆桌会探寻下半年文旅消费新路径

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版