如果把这轮AI浪潮拆开来看,你会发现一个正在发生的根本性转移:衡量价值的核心,不再是GPU的算力本身,而是“每单位成本能产出多少Token”。
本篇文章试图回答一个市场反复纠结的问题—— 为什么每一代GPU,对HBM的需求几乎注定是指数级增长?更关键的是,这种增长为什么不会像过去那样中途停滞?这也是我长期买多三星和海力士的理论基础(凭借这个看多的论点,近一个月本人美股的收益率78%)。
![]()
一、一个被忽视的第一性原理
在当前架构下,可以把AI推理的本质简化为一句话:
Token吞吐量 ≈ HBM容量 × HBM带宽
这不是一个经验结论,而是从系统结构推导出来的硬约束。
换句话说: GPU的上限,不再由算力单独决定,而是被HBM的两个维度“锁死”。
二、为什么过去的内存不重要?
要理解今天,必须先回到CPU时代。
在那个阶段,整个产业的核心KPI只有一个:性能(performance)。 CPU不断通过提高频率、超标量执行(superscalar)、乱序执行等方式去“跑得更快”。
而内存(DDR)在体系中的角色,其实非常边缘。
为什么?
第一,CPU擅长“掩盖延迟” 通过多级缓存(L1/L2/L3)、寄存器重命名、超大乱序窗口等机制,把对内存的依赖尽可能隐藏。
第二,绝大多数负载根本不缺带宽 无论是本地应用还是云端任务,DDR带宽长期处于“过剩状态”。
结果就是: 即便内存速度翻倍,对CPU性能的提升往往不到20%。
这直接导致一个现实: 从DDR3到DDR5,技术迭代拉长到十多年,容量增长也极其温和——十年大约3倍。
本质上,DRAM在CPU时代只是“配角”: 它的升级,对核心KPI几乎没有决定性影响。
三、AI时代:KPI被彻底改写
进入生成式AI时代,一切都变了。
GPU不再围绕“算力跑分”,而是围绕两个指标: • 单位成本的Token产出(核心商业指标) • Token生成速度(用户体验指标)
这就是所谓的“Token经济学”。
在这个框架下,系统优化的目标变成一条曲线: 在吞吐量(throughput)和速度(latency)之间,尽可能逼近最优边界(Pareto frontier)。
NVIDIA提出“AI工厂”的概念,本质就是一件事: 用最低成本,产出最多Token,同时尽可能快。
四、关键转折:从单卡到系统级“Token工厂”
在早期单卡GPU时代(batch size≈1),逻辑很简单: • Token吞吐 ≈ HBM带宽
但进入类似NVL72这种系统架构后,一切复杂起来: • 72个GPU + 多CPU协同 • 推理从“单线程”变成“系统级并行”
此时,Token吞吐被拆成两个变量:
Token吞吐 = 批处理规模(Batch Size) × 单用户Token速度
五、第一个瓶颈:HBM容量(Size)
为什么Batch Size受限?
因为每一个请求都会占用一块KV Cache,而这部分数据必须常驻HBM。
随着Batch增加:
KV Cache线性增长
所有数据必须同时驻留在HBM中
于是得到一个刚性约束:
Batch Size的上限,本质取决于HBM容量
可以把它理解成机场摆渡车:
车厢大小 = HBM容量
一次能拉多少人 = Batch Size
车太小,再多人也得分批运,吞吐上不去。
六、第二个瓶颈:HBM带宽(Bandwidth)
再看单用户Token速度。
在大模型的decode阶段,每生成一个Token,都需要:
多次读取权重
高频访问KV Cache
而这些操作的瓶颈,不在算力,而在数据搬运速度。
于是得到第二个结论:
Token生成速度 ≈ HBM带宽
继续用刚才的比喻:
车门宽度 = 带宽
门越宽,上车越快
即使车很大(容量高),门太窄(带宽低),整体效率仍然很差。
七、把两件事合在一起
现在可以得到一个更清晰的表达:
Token吞吐 = Batch Size × Token速度 ≈ HBM容量 × HBM带宽
这就是AI推理时代最核心的硬件公式。
也意味着一件非常重要的事:
如果Token吞吐要“每代翻倍”, 那么HBM容量 × 带宽的乘积,也必须同步翻倍。
八、为什么这一次“周期不会重演”?
市场争议的核心在这里:
历史上,DRAM也是周期品—— 需求上涨 → 厂商扩产 → 供给过剩 → 周期下行
那HBM会不会重蹈覆辙?
问题在于,这次的需求结构完全不同。
过去:
DRAM需求来自设备数量增长
属于“可波动需求”
现在:
HBM需求直接绑定Token吞吐
属于“系统刚性需求”
只要AI系统还在追求更高吞吐:
GPU必须升级
而GPU的上限被HBM锁死
这是一种供给侧被动驱动的需求,而不是需求侧自发波动。
九、软件会不会改变这一切?
一个常见误区是: “软件优化可以降低对HBM的需求。”
这在逻辑上是站不住的。
原因很简单:
软件优化 ≠ 可以停止硬件进步
就像CPU一样:
软件可以更高效
但CPU每一代仍必须跑分更高
否则就没有商业价值。
GPU也是同理:
无论软件如何优化,Token吞吐这个KPI必须持续提升。
只要这个目标不变: • 对HBM容量的需求不会下降 • 对HBM带宽的需求也不会下降
十、真正的变化:HBM走上舞台中央
在CPU时代,内存是配角。 在AI时代,HBM成为“天花板”。
它不再是锦上添花,而是决定系统上限的核心变量。
甚至可以说:
GPU的竞争,本质正在转化为HBM能力的竞争。
十一、最后的问题
当需求被“物理规律”锁定为指数增长后,故事只剩下一个悬念:
过去三十年里,存储行业反复上演同一个剧本—— 在繁荣中扩产,在扩产中崩盘。
那么这一次——
当HBM成为AI时代的刚性基础设施, 供给侧的三大玩家,还会不会再次把自己拖入周期的深渊?
关注我,我们一起埋伏在大部队前进的路上。
这里是《逻辑与常识》,用逻辑看市场,用常识做投资。
如果这篇文章对你有帮助,转发给同样在投资路上摸索的朋友。
![]()
早七点准时发文
大家好,我是江南君,一个路见不平一声吼的老boy。
做过监理,行政,金融,设计,干过培训,超市,餐饮,投资,外贸……目前常住越南。
喜欢写点文字,思考点人生,管管闲事。
多年后,当后人问我对社会做了哪些贡献时,我会自豪地说,面对事实,我做了诚实的记录和评论。
为防失联,加好友(67932342)
投资认知类文章
10万+文章
【社会】
【社会】
【社会】
【社会】
【社会】
【社会】
【时事】
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.