网易首页 > 网易号 > 正文 申请入驻

融资百亿不赚钱,DeepSeek的10万亿战略

0
分享至

当整个AI行业都在疯狂追赶多模态、视频生成、coding agent的时候,有一家公司对这些「风口」几乎视而不见。

没有coding plan,没有语音模型,没有视频模型,到现在连一个完整的模型部署框架(harness)都还没搭起来。更「离谱」的是,它还坚持把最核心的技术全部开源,毫无保留地分享自己的「秘方」。

这家公司是DeepSeek。

另一边,彭博社刚报道DeepSeek新融资规模已达700亿元(约100亿美元)。梁文锋对投资者放的话也很直接:优先突破技术边界,而不是急着变现。

乍看之下,这种行为简直像个悖论。一家不开源就等于「犯罪」的公司,偏偏锁死了开源。一家不做任何商业化产品的AI公司,偏偏还在大把烧钱。一个估值直奔千亿美元的超级独角兽,偏偏看起来没有任何明确的变现路径。

这是疯狂吗?是钱多烧得慌吗?是投资人在往排水沟里扔钱吗?


X博主@bookwormengr(一位长期追踪中国AI生态的分析师)在他的万字推文里给出了截然相反的判断:

DeepSeek不是在烧钱,它是在下一盘10万亿美元的棋局。
一个「反着来」的英雄旅程

要理解DeepSeek今天的选择,得先看看它一路走来是怎么「反着来」的。

2025年1月,@bookwormengr 发了一条后来成为爆款的推文,他把DeepSeek的选择放在「英雄之旅」的叙事框架里解读。半年多过去,这个故事不但没过时,反而越来越精彩了。

当时所有人都在卷dense model(密集模型),DeepSeek偏偏跑去搞MoE(混合专家模型)。没人否认MoE的理论优势,但它训练难度大、推理效率难优化,「吃力不讨好」。DeepSeek不仅搞了,还搞成了,从V2到V3再到V4,MoE被它玩出了花。

当行业主流在用PPO(近端策略优化)做强化学习时,DeepSeek从第一性原理出发,发明了GRPO(分组相对策略优化)。PPO需要一个独立的「裁判模型」来提供奖励信号,GRPO直接省掉这个环节,更便宜,更高效。

当大家都在追逐更多模态时,DeepSeek把资源全部集中在了一件事上:推理能力。它找到了一个关键杠杆,基于验证奖励的强化学习(RLVR),让模型在数学和逻辑推理上突飞猛进。

从技术路线到产品策略,DeepSeek几乎每一次都在「反着走」。但仔细看,每一次「反着走」都指向同一个方向:把资源效率压榨到极致。

而在「英雄之旅」的叙事结构中,英雄从来不会事先规划自己的旅程。他是一路学习、一路遭遇挑战、一路找到盟友,最终发现自己真正的使命。DeepSeek的使命也越来越清晰了:不是卖coding plan,而是为中国的AI硬件生态铺路。

一张恐怖的KV Cache账单

要理解这个使命,得从一张账单说起。

AI模型处理长文本时,需要缓存一种叫KV Cache(键值缓存)的东西。上下文越长,KV Cache占用的HBM(高带宽显存)就越大。1M上下文?对大多数模型来说,KV Cache会把显存吃到怀疑人生。


@bookwormengr 用了一个刚发布的KV Cache计算器做了对比。输入1M上下文,假设8位KV精度和16位索引精度:

  • DeepSeek V4:只需要5.48GB HBM

  • GLM-5:需要60GB HBM

  • Qwen3-235B-A22B:需要89GB HBM

记住,DeepSeek V4是一个1.6万亿参数的巨型模型,GLM-5约7000亿参数(已经用了DeepSeek的MLA和DSA技术但没用最新的压缩注意力),Qwen3约2350亿参数(用的是GQA注意力机制)。

参数规模是GLM的两倍多、Qwen的近7倍,KV Cache却只有对方的十分之一甚至二十分之一。

用@bookwormengr的话说:「DeepSeek在显存压力上做出了根本性的贡献。」

这解释了为什么DeepSeek敢把长上下文缓存的价格打到Sonnet 4.6 Cache Hit价格的不到3%,还能保持数小时的缓存有效期。KV Cache足够小,可以高效卸载到SSD上再快速加载回来,DeepSeek的Dual Path论文专门讲了这件事。

当然,DeepSeek V4的压缩注意力(CSA/HCA)已经把KV Cache压缩到了连SSD卸载都不一定需要的程度。但这恰恰说明了一件事:DeepSeek所有的技术选择,都指向同一个战略方向:降低对HBM的依赖。

为什么要降低HBM的依赖?因为HBM是中国AI硬件生态中最难啃的骨头。

七项核心技术,全部指向同一个方向

DeepSeek过去两年的创新清单,拆开来看每一项都对应着一个具体的「战略棋子」。

1. MoE和MLA(2024年5月,DeepSeek V2)

这是DeepSeek技术路线的「地基」。MoE让训练同样智能的模型省下40%到50%的算力。MLA(多头潜在注意力)直接把KV Cache砍掉90%。这两项加在一起的效果是:模型的训练和推理成本大幅降低,KV Cache小到可以高效卸载到SSD。

2. DSA(DeepSeek V3.2 Exp)

DSA(动态稀疏注意力)解决的是长上下文的算力问题。传统Transformer面对长文本时,计算量和上下文长度呈线性增长。DSA让这个增长曲线几乎持平。上下文增长到1M,处理时间依然保持平稳。这相当于在不增加算力投入的前提下,把模型的长上下文能力「白送」了出来。

3. mHC(2025年12月论文)

mHC(流形约束超连接)是DeepSeek在宏观架构上的创新。传统的残差连接用的是「x + F(x)」的简单加法,mHC把这条信息高速公路扩展成了多条并行通道,允许信息在层与层之间「学会」混合。更关键的是,它用数学约束(双随机矩阵)保证信号在极深的网络中不会爆炸或消失。

效果是什么呢?在270亿参数规模下,mHC让BIG-Bench Hard推理得分提升7.2分,DROP阅读理解提升3.2分,GSM8K数学提升2.8分,而计算开销只增加了6.7%。用@bookwormengr的话说:「用几乎不增加算力的代价,实现了更高的每参数智能密度。」

4. CSA和HCA(2026年4月,DeepSeek V4)

如果说MLA砍掉了90%的KV Cache,CSA(压缩稀疏注意力)和HCA(分层压缩注意力)在此基础上再砍90%。这是DeepSeek V4能将1.6万亿参数的KV Cache压到5.48GB的核心原因。

5. Engram(2026年1月论文)

Engram是DeepSeek最「反常」的一项创新。MoE已经实现了条件计算,只激活部分参数来节省算力。但DeepSeek发现Transformer缺乏一个「原生知识查询」的机制,不得不用计算来模拟查询。

Engram的解决方案很巧妙:把经典的N-gram模型现代化,变成一个O(1)哈希查找模块。它用内存换计算,查一次LPDDR内存比过一遍Transformer层便宜得多。这种「内存换算力」的取舍,放在西方GPU上可能不值得,但放在中国硬件生态里,意义完全不同。

6. TileLang(编译器生态)

除了技术,DeepSeek更深远的一步是投资了TileLang,一个编译器生态项目。它的作用很简单:让开发者写一次算子代码,就能在多种硬件平台上运行。这对于打破「CUDA护城河」至关重要。

7. Dual Path和计算通信重叠

Dual Path论文表面上是「算力受限下的权宜之计」,但DeepSeek走得更远,在V4论文中直接给出了对硬件厂商ASIC设计的建议,告诉他们「如何不浪费宝贵的硅片面积」。可以想象,面对面给出的建议只会更加具体。

不只是一堆技术论文,而是一张生态图谱

现在把这些技术拼在一起,就能看清DeepSeek的真正布局了。

KV Cache被极度压缩,HBM需求大幅下降。KV Cache可以高效卸载到SSD上,NAND闪存吃香了。

NAND是长江存储(YMTC)的主场,它正在成为3D NAND领域的全球玩家。DeepSeek的技术直接为长江存储创造了一个巨大的NAND和SSD市场。

不止NAND。DeepSeek的Engram模块用LPDDR内存作为查找表来节省算力。而LPDDR正是长鑫存储(CXMT)的主场。CXMT在速度上只落后最新制程半代,在密度上落后一代,差距很小,短时间内可以补齐。

中国GPU在原始FLOPs上永远追不上西方,原因是先进制程(EUV)和先进封装的双重限制。但DeepSeek的策略不是去硬碰硬的拼算力,而是另一条路:用充裕的NAND和LPDDR来弥补GPU算力的不足。

SGLang团队已经发布了一篇很好的博客,演示了如何用LPDDR来存储模型权重,在推理时按需「流式」加载到HBM中。DeepSeek的MoE架构(大量专家组合+4bit量化权重)让这种方案变得非常简单。


所有这些创新的共同效果是:降低了对HBM的依赖,降低了对高端GPU的依赖,让更多「够用但不顶尖」的硬件方案变得可行。

这就是DeepSeek真正的「产品」:一个让中国AI硬件生态变得可行的技术底座。

从OpenAI的AMD deal看DeepSeek的赚钱方式

技术服务于生态,但公司终究要赚钱。DeepSeek怎么变现?

@bookwormengr 在推文中给出了一个很有说服力的参照系。

2025年10月,AMD和OpenAI宣布了一项战略合作:AMD将向OpenAI供应高达6GW的GPU算力,作为条件,AMD向OpenAI授予了高达1.6亿股的认股权证,按里程碑解锁。首期1GW部署完成解锁第一批,后续随采购规模逐步解锁,同时和AMD的股价目标挂钩。

说白了,OpenAI通过「承诺使用你的硬件」来换取「持有你的股票」。这对AMD是巨大的信任背书,对OpenAI则是潜在的巨大财务回报。

@bookwormengr 预测,DeepSeek会走同样的路,和中国多家内存、ASIC、CPU和网络设备厂商签署类似的股权合作协议,深度参与它们硬件生态的打磨,让中国硬件的AI工作负载真正达到可用水准。

看看西方(包括东亚盟友)的AI相关股票的合计市值,远超10万亿美元。DeepSeek完全可以用「合作+股权」的模式,帮助创造一个同样体量的中国AI生态,从中拿到自己的那份,同时实现1万亿美元的自身估值。

用@bookwormengr的话说:「梁文锋,一个吉姆·西蒙斯的忠实粉丝,是个太聪明的资本家了,不可能错过这个。」

DeepSeek今天做的东西,整个行业明天都会用

其实这个路径已经开始了。DeepSeek的MoE、MLA、DSA等创新,已经被全球和中国其他AI实验室广泛采用。

智谱AI(ZAI)的GLM系列用了MLA和DSA,月之暗面(Moonshot)的Kimi也明确表示架构基于DeepSeek。反过来,DeepSeek也用了月之暗面率先在大规模训练中使用的Muon优化器。整个中国AI生态正在形成一种「互相借鉴、共同进化」的默契。

有了更多的硬件选择,以及自身对算力需求的极致压缩,DeepSeek可以承担更宏大的训练项目,特别是大规模强化学习后训练。RL训练需要生成海量的推理轨迹,动辄数万亿token,1M上下文的模型更是需要训练同样长的轨迹。这些对算力的需求是天文数字,但DeepSeek正在把成本降到可以承受的水平。

更进一步,更多的硬件选择意味着DeepSeek可以做自动化研究(RSI),让AI自己设计并执行实验。这条路有很多的试错成本,但它对于探索完整的设计空间来说是必要的。在到达AGI、继而到达ASI之前,RSI能力是必备的。

从今天往回看,DeepSeek一路上的所有选择,不着急做多模态、不卖coding plan、坚持开源、技术优先商业化其次,突然都有了清晰的逻辑。

这不是一家迷茫的公司在瞎折腾,而是一个目标极其清晰的团队在按部就班地执行一个十年计划。它的每一步技术发布,都是这个计划的一块拼图。

DeepSeek的KV Cache压缩技术大幅减少了HBM需求,这让长江存储和长鑫存储的产品在AI推理场景中变得更有价值。它的MoE和TileLang降低了GPU门槛,这让中国境内的GPU厂商有了切入AI市场的机会。它的开源策略确保了这些技术能快速扩散到整个生态,进而加速中国硬件的迭代。

最终,DeepSeek不需要亲自做出一款「爆款应用」来赚钱。它只需要让中国AI硬件生态变得可用,让这个生态里的每一个玩家都离不开它的技术贡献。

一个10万亿美元的行业生态,和它自己1万亿美元的估值,这才是梁文锋瞄着的目标。

从任何一个角度看,这个赌注都够大。

但回头想想DeepSeek一路走来的「反着走」记录,被质疑了,质疑错了,再被质疑,再被质疑错,也许该学会的是:当DeepSeek在做一件看起来「不合理」的事情时,很可能不是因为疯了,而是因为看到了别人还没看到的东西。

本文编译自@bookwormengr的X推文「DeepSeek's 10 trillion USD grand strategy」

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
印度极有可能成为一颗”毁灭“世界的定时炸弹,要知道,印度人口看似15亿,但明眼人都能看出来,这大概率是一个保守数字

印度极有可能成为一颗”毁灭“世界的定时炸弹,要知道,印度人口看似15亿,但明眼人都能看出来,这大概率是一个保守数字

扶苏聊历史
2026-09-15 11:52:37
胡塞打进城,先给百姓发大米,难怪势如破竹,真给他们学到精髓了

胡塞打进城,先给百姓发大米,难怪势如破竹,真给他们学到精髓了

施涛说
2026-09-16 17:00:03
中俄蒙三国一致同意,把躺着数钱的机会,送到了蒙古的嘴边?

中俄蒙三国一致同意,把躺着数钱的机会,送到了蒙古的嘴边?

椰青美食分享
2026-09-17 00:00:21
中国必须高度警惕越南将发生的分裂危机!

中国必须高度警惕越南将发生的分裂危机!

叶老四
2026-08-31 08:51:57
国产奔驰长轴距GLE上市!共推出5款车型,网友:价格劝退

国产奔驰长轴距GLE上市!共推出5款车型,网友:价格劝退

汽车网评
2026-09-16 21:58:28
影视飓风Tim反掰iPhone Duo引骂战!李楠:是较真还是故意博流量?

影视飓风Tim反掰iPhone Duo引骂战!李楠:是较真还是故意博流量?

雷科技
2026-09-17 14:09:24
电动车最伤电池的,不是天天充,是天天骑到两成以下还一整夜不拔

电动车最伤电池的,不是天天充,是天天骑到两成以下还一整夜不拔

白米饭怎么吃
2026-09-17 21:29:45
沙特两通求助电话被特朗普拒绝,美国转头与胡塞密谈达成“默契”?

沙特两通求助电话被特朗普拒绝,美国转头与胡塞密谈达成“默契”?

上观新闻
2026-09-17 19:16:09
街上越来越多女性不穿胸罩,高跟鞋几乎绝迹:这是身体的解放!

街上越来越多女性不穿胸罩,高跟鞋几乎绝迹:这是身体的解放!

另子维爱读史
2026-08-25 20:02:40
比尔盖茨:中美大模型各有4家 能保持最先进水平

比尔盖茨:中美大模型各有4家 能保持最先进水平

快科技
2026-09-15 14:29:07
华为战败!

华为战败!

钧言堂
2026-08-05 20:22:01
房价很大可能重走1998年老路!所有人一定要提前做好心理准备

房价很大可能重走1998年老路!所有人一定要提前做好心理准备

偷喝一口奶
2026-09-11 08:36:30
不管炖什么肉,只要加了这4味料,肉软烂入味,越炖越香,早知道

不管炖什么肉,只要加了这4味料,肉软烂入味,越炖越香,早知道

阿龙美食记
2026-09-16 16:48:46
请马上停下这5种运动,否则心脏可能先报废,很多老人还在坚持

请马上停下这5种运动,否则心脏可能先报废,很多老人还在坚持

王二哥老搞笑
2026-09-16 15:16:04
许多中年女人,都不喜欢男人亲她的嘴,到底为什么?

许多中年女人,都不喜欢男人亲她的嘴,到底为什么?

大熊欢乐坊
2026-08-26 10:17:05
算是踢到铁板了!这届日本亚运会,给全世界好好上了一课:没有中国,生意很难做

算是踢到铁板了!这届日本亚运会,给全世界好好上了一课:没有中国,生意很难做

扶苏聊历史
2026-09-10 14:58:19
这和不穿有啥区别?宋雨琦现身上海夜店,蹦迪喊麦动作大胆奔放

这和不穿有啥区别?宋雨琦现身上海夜店,蹦迪喊麦动作大胆奔放

林轻吟
2026-09-16 16:17:46
特斯拉Model Y L后悬架调查追踪:华域汽车旗下公司仍向Model 3、Model Y等供应悬架弹簧,车主手册离地间隙出现两种数据

特斯拉Model Y L后悬架调查追踪:华域汽车旗下公司仍向Model 3、Model Y等供应悬架弹簧,车主手册离地间隙出现两种数据

每日经济新闻
2026-09-17 16:03:50
央国企涌现一批的“新型干部”:满嘴战略,句句赋能,就是难落地

央国企涌现一批的“新型干部”:满嘴战略,句句赋能,就是难落地

可乐爱微笑
2026-09-16 13:41:06
直播3小时副乳走光无人管:流量退潮时,体面才是最后的遮羞布

直播3小时副乳走光无人管:流量退潮时,体面才是最后的遮羞布

放开他让wo来
2026-09-16 00:05:28
2026-09-17 22:08:49
大厂观察 incentive-icons
大厂观察
你想了解的大厂的一切~
228文章数 42关注度
往期回顾 全部

财经要闻

缺钱的追觅 隐藏的债务?

头条要闻

退休副省长家中243万名酒被偷 管家获刑后举报其贪腐

头条要闻

退休副省长家中243万名酒被偷 管家获刑后举报其贪腐

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

汽车要闻

猛士X700内饰公布 华为技术加持打造家庭泛越野智能座舱

态度原创

房产
健康
数码
艺术
公开课

房产要闻

突发!三亚安居房出台新政!

剧烈头痛伴呕吐,警惕脑动脉瘤破裂

数码要闻

999元!小米发布米家空气净化器6C:甲醛去除率99%

艺术要闻

海因里希·伯默:德国写实风景画家

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版