本文试图从 GPU → Board → Server → Rack → Cluster,看AI芯片竞争单位的迁移。如果一家AI芯片公司今天仍然把自己的产品定义为“一颗GPU”,它可能正在用上一代半导体产业的产品逻辑,参加下一代计算系统的竞争。
原因并不复杂。
客户真正购买的,从来不是TFLOPS。
训练大模型的客户购买的是:多久能把模型训练出来。
做推理的客户购买的是:在给定延迟和SLA下,一美元能生成多少token。
建设数据中心的客户购买的是:在有限的电力、机柜、网络和运维能力下,一个MW究竟能产生多少有效AI计算。
当这些指标成为真正的商业指标之后,决定竞争力的东西就不可能只存在于GPU芯片内部。
于是过去十几年里,我们看到AI计算的产品单位不断向外扩张:
GPU
↓
Board
↓
Server
↓
Rack
↓
Cluster
这并不是简单地“把更多GPU装在一起”。
它背后真正发生的是:
AI计算的主要瓶颈,正在不断从芯片内部迁移到芯片外部。
而谁能够控制新的瓶颈,谁就有可能重新定义AI芯片公司的边界。
大家好,我是虎哥,欢迎订阅我的半导体课程:
一、为什么“更快的GPU”越来越不等于“更快的AI系统”?
理解这个问题,首先要重新看摩尔定律。
过去几十年,半导体公司最习惯的竞争方式是:
制程升级 → 晶体管增加 → 频率或并行度提升 → 单芯片性能提高。
只要一颗处理器更快,系统大概率也会更快。
但AI计算开始打破这种简单关系。
因为AI计算并不是纯粹的算术问题,而是一个巨大的数据移动问题。
矩阵乘法需要数据。
模型权重需要从HBM读取。
Activation需要传输。
训练过程中的梯度需要在GPU之间同步。
推理中的KV Cache需要不断访问。
模型并行以后,一块GPU算完的数据还要交给下一块GPU。
也就是说:
计算能力越强,对内存、互联和供电提出的要求反而越高。
于是一个非常重要的变化出现了:
FLOPS增长速度,可以快于“把数据送到计算单元”的速度。
这时候继续增加Tensor Core,并不一定能够同比例提高真实模型性能。
如果HBM带宽不足,Tensor Core会等待。
如果GPU之间通信不足,GPU会等待。
如果网络拥塞,整个训练集群都会等待。
如果功率密度过高,服务器甚至装不进去。
所以今天分析AI芯片,只看峰值算力已经越来越没有意义。
真正应该看的,是:
有效算力 = 计算能力 × 内存效率 × 通信效率 × 软件效率 × 系统利用率。
这也是为什么AI芯片的竞争自然会从GPU向外扩张。
二、第一步:GPU → Board
很多人讨论AI芯片时,实际上把GPU die和GPU产品混在了一起。
但真正进入数据中心以后,裸芯片几乎没有意义。
GPU首先必须变成一个完整的计算模块。
这一层开始出现:
HBM、先进封装、供电、电源管理、高速SerDes、PCIe、NVLink/Infinity Fabric等高速互联。
从这一刻开始,AI计算已经不再是单颗逻辑芯片的问题。
例如,一颗GPU即使拥有非常强的矩阵计算能力,如果HBM容量不足,一个模型就必须被切到更多GPU上。
GPU数量增加以后,又会产生新的通信需求。
于是:
内存问题变成互联问题。
互联问题进一步又会变成:
功耗问题、封装问题和系统拓扑问题。
这就是AI计算最典型的“瓶颈迁移”。
解决一个瓶颈,经常会制造下一个瓶颈。
所以今天GPU真正的竞争力已经不是:
“我的MAC单元比你多多少?”
而是:
在给定封装、HBM容量、带宽和功耗条件下,我能不能让这些MAC长期保持高利用率?
这是GPU第一次变成“系统问题”。
三、第二步:Board → Server
再往外走一层,就到了服务器。
传统服务器时代,CPU是中心。
GPU更像一个PCIe外挂加速器。
但AI服务器越来越不同。
现在GPU往往才是系统的核心资产。
CPU、NIC、DPU、PCIe Switch、内存和NVMe,反而围绕GPU进行设计。
这意味着服务器架构发生了一次“主次关系倒置”。
一台AI服务器真正需要解决的问题包括:
CPU与GPU如何协同?
八块GPU之间怎么连接?
GPU访问NIC经过什么路径?
PCIe有没有oversubscription?
网络数据能否直接进入GPU?
通信能否与计算overlap?
服务器故障以后如何快速隔离和更换?
BMC如何管理?
软件如何识别整个拓扑?
这些问题,没有任何一个可以单靠GPU芯片解决。
所以从这一代AI开始,真正有竞争力的GPU公司越来越需要提供的不只是芯片,而是:
经过验证的服务器计算拓扑。
HGX这一类产品的意义就在这里。
它卖的并不仅仅是若干颗GPU放到PCB上。
真正重要的是:
GPU之间应该怎样组成一个确定性的高速计算域。
四、第三步:Server → Rack
而今天最值得关注的变化,其实是下一步:
服务器本身,也正在变得太小。
为什么?
因为模型并行规模继续扩大。
八块GPU已经不足以构成理想的Scale-up domain。
如果GPU跨服务器通信,传统网络的延迟和带宽就可能成为瓶颈。
于是产业开始尝试一件事情:
把整个Rack重新设计成一台计算机。
这也是NVIDIA GB200 NVL72真正值得研究的地方。
NVIDIA的官方架构中,一个NVL72机柜包括72颗Blackwell GPU、36颗Grace CPU,并通过NVLink形成72-GPU高速互联域;官方给出的整个NVLink系统聚合带宽达到130TB/s。它已经不再把机柜描述成若干独立服务器,而是强调一个Rack可以形成类似“单个巨大GPU”的计算域。
注意这里最重要的不是“72”这个数字。
而是产品定义发生了变化。
以前:
机柜只是装服务器的铁架子。
现在:
机柜本身成为计算架构的一部分。
里面有:
Compute Tray、
NVLink Switch Tray、
网络交换、
电源Shelf、
Busbar、
液冷Manifold、
管理网络,
所有这些东西共同组成一个计算产品。
这意味着AI芯片公司的工程边界已经碰到了电气工程甚至暖通工程。
以NVIDIA公开的GB300 NVL72参考架构为例,完整机柜功率需求最高可到约142kW。
当一个Rack达到100kW以上以后,问题就不再只是“芯片性能”。
供电架构必须变化。
液冷必须参与系统设计。
铜缆长度会影响互联。
电源转换效率开始影响TCO。
机柜重量、维修空间、快速接头甚至漏液检测,都成为产品问题。
于是出现一个很有意思的现象:
AI芯片公司的竞争,正在第一次系统性进入数据中心物理基础设施。
五、这并不是NVIDIA一家公司的特殊路线
如果这只是NVIDIA自己的封闭体系,我们或许可以把它理解为一家公司的纵向整合战略。
但AMD正在沿着非常类似的方向发展。
2026年AMD正式公布Helios Rackscale方案,把72颗MI455X GPU、EPYC CPU、Pensando网络和ROCm软件放进一个统一的Rack-scale架构。
AMD公开规格中,Helios最多提供约31TB HBM4容量以及约1.67PB/s理论内存带宽。更重要的是,AMD明确把Helios定义成一个Rack-scale reference design,而不是单独销售的一台机器,并试图通过OCP、UALink和UEC等开放标准交给OEM/ODM生态构建。
这说明真正值得注意的不是谁的Rack参数更高。
而是:
两条技术路线正在得出同一个产品结论。
一条路线强调:
专有高速互联 + 强垂直整合 + 软件生态。
另一条路线强调:
开放互联 + 标准化Rack + OEM生态。
但双方都开始认为:
下一代AI计算的基本产品单元,很可能已经不是GPU,而是Rack。
六、为什么Rack之后还要走向Cluster?
Rack仍然没有解决所有问题。
因为一个Rack有72颗GPU也好,144颗GPU也好,对于最前沿模型训练来说仍然远远不够。
于是Scale-up之后一定还有Scale-out。
这时候整个数据中心网络就变成了另一层计算架构。
可以把它简单理解为:
NVLink/UALink解决“近距离GPU通信”。
而InfiniBand或者高性能Ethernet负责:
把不同Rack组成更大的计算机。
这时网络已经不再只是数据中心的基础设施。
它实际上变成了一块巨大的:
分布式背板。
一旦走到Cluster级别,决定系统性能的变量进一步增加:
网络拓扑、
交换芯片、
NIC、
拥塞控制、
Collective Communication Library、
任务调度、
存储、
Checkpoint、
故障恢复、
软件编排。
如果有10000颗GPU,其中几十颗出现异常并不是偶然事件,而会成为日常状态。
此时真正的问题已经变成:
一个拥有10000颗GPU的系统,能够有多少GPU长期参与有效计算?
这就是为什么“买了一万块GPU”和“拥有一万块GPU的有效算力”,完全不是一回事。
七、训练和推理,会进一步推动系统分化
接下来还有一个容易被低估的变化:
训练和推理正在变成两种越来越不同的系统工程。
训练更关心的是:
大规模同步、
AllReduce、
通信带宽、
并行效率、
Checkpoint、
长时间稳定运行。
简单来说:
训练希望几千甚至几万颗GPU像“一颗GPU”一样工作。
而推理开始出现完全不同的问题。
尤其是LLM推理可以进一步拆成:
Prefill和Decode。
Prefill具有更明显的计算密集属性。
Decode则非常依赖:
HBM带宽、KV Cache容量和访问效率。
随着上下文长度扩大,KV Cache本身就可能成为巨大的内存系统。
此时推理系统真正优化的也不再是FLOPS,而是:
TTFT——首Token延迟,
TPOT——每Token生成时间,
吞吐量,
并发量,
以及最终最重要的:
Cost per Token。
因此未来甚至可能出现更明显的异构系统:
Prefill使用一种计算资源,
Decode使用另一种资源,
KV Cache拥有独立的内存层级,
网络负责把它们组合起来。
于是AI芯片真正的架构单位甚至可能继续从Rack扩展到:
整个推理集群。
八、到了这一步,“芯片架构”实际上已经变成“系统架构”
这也是下一代AI芯片公司最大的认知变化。
以前设计GPU时,架构团队的核心问题可能是:
多少计算单元?
多少Cache?
多少Tensor Core?
多少HBM?
多少SerDes?
以后产品定义会议上的问题可能会变成:
一个Rack放多少GPU?
Scale-up domain应该多大?
每颗GPU需要多少HBM?
每个Rack需要多少网络带宽?
供电效率是多少?
液冷怎么布置?
一个Cluster需要多大的Bisection Bandwidth?
模型并行如何映射到物理拓扑?
Compiler能否感知拓扑?
Runtime是否能自动做通信与计算重叠?
KV Cache放在哪里?
发生链路故障以后任务能否继续运行?
这时候所谓“芯片架构师”,实际上已经越来越接近:
计算系统架构师。
九、但做“系统”绝不意味着简单堆更多芯片
这里必须强调一个非常容易出现的误区。
很多人看到Rack-scale计算后,会得出一个简单结论:
单芯片不够强,就多堆一些芯片。
实际上完全不是这样。
假设A芯片单卡性能只有B芯片的80%。
理论上,多放25%的芯片就可以补回来。
但现实中你同时增加了:
HBM成本、
封装成本、
电源成本、
网络成本、
机柜数量、
光模块、
交换机、
冷却系统,
以及软件和故障概率。
更麻烦的是,芯片数量增加以后通信量往往也会增加。
于是可能出现:
芯片差距 → 多芯片补偿
↓
通信量增加
↓
网络升级
↓
功耗增加
↓
机柜数量增加
↓
数据中心基础设施成本上升。
最后你虽然补回了FLOPS,却没有补回:
TCO。
所以评价下一代AI系统,真正应该问的不是:
一块GPU多少钱?
而是:
完成同一个模型训练任务,总共需要多少钱?
推理则应该问:
在同样延迟和服务质量要求下,一个Token到底多少钱?
这才是系统竞争的终点。
十、为什么芯片公司都想扩大自己的“产品边界”?
理解了前面的逻辑,就会发现一个更深的产业问题。
为什么AI芯片公司越来越愿意做系统?
因为谁控制系统,谁就更容易控制自己的芯片实际表现。
如果你只卖GPU:
服务器厂商可能设计不好PCIe拓扑。
网络可能配置不好。
电源可能不足。
散热可能降频。
通信库可能没有优化。
最终客户跑出来的性能很差。
但客户不会说:
“这台服务器架构设计有问题。”
客户通常只会说:
这颗GPU性能不行。
所以对于顶级AI芯片公司而言,系统设计越来越像一种“性能保险”。
通过控制Board、Server和Rack,它可以确保芯片运行在自己预期的环境中。
与此同时,产品边界扩大还有另一个价值:
可以把更多跨层优化变成产品能力。
例如:
芯片知道网络拓扑,
Compiler知道芯片拓扑,
Runtime知道通信状态,
Scheduler知道模型结构,
最终整个系统一起决定任务怎么跑。
这些优化单独看可能只有5%、10%。
但如果十个层次分别获得一些收益,最终系统差距就可能非常大。
真正难复制的东西,也就从“一个芯片架构”变成:
几十个工程层之间长期形成的协同。
十一、真正的护城河可能不是GPU,而是“接口控制权”
这也是AI芯片竞争未来最值得观察的一点。
系统越来越大以后,有两种完全不同的发展路线。
第一种是:
强垂直整合
GPU、CPU、Scale-up互联、NIC、交换机、软件甚至Rack架构由同一体系设计。
优势是:
跨层优化能力强。
代价是:
体系更加封闭,客户切换成本更高。
第二种是:
开放模块化
GPU来自一家,
CPU来自另一家,
网络来自第三家,
通过标准协议组成Rack。
优势是:
供应链灵活,客户选择更多。
代价则是:
跨层优化和系统验证更加困难。
因此未来真正的产业竞争未必只是:
NVIDIA GPU vs AMD GPU vs 各类ASIC。
更深一层可能是:
封闭但高度优化的计算系统,和开放但模块化的计算系统之间的竞争。
最终决定胜负的不会是“开放”或者“封闭”这两个标签。
而是:
性能、
TCO、
供应能力、
软件成熟度、
可靠性,
以及客户是否愿意承担锁定成本。
十二、这对下一代AI芯片创业公司意味着什么?
这里反而有一个残酷现实。
系统竞争并不意味着每一家AI芯片公司都应该自己造服务器、机柜和数据中心。
这样做很可能死得更快。
因为从芯片走向系统意味着组织复杂度爆炸。
你需要的不再只有:
芯片架构、
RTL、
验证、
后端、
Driver和Compiler。
还需要:
SI/PI、
高速PCB、
网络、
机械结构、
液冷、
电源、
Firmware、
BMC、
系统验证、
可靠性、
供应链、
现场支持。
这是完全不同的公司能力。
所以对于创业公司来说,更合理的路径可能不是“什么都自己做”。
而是必须回答一个新的产品问题:
我究竟把产品边界定义在哪里?
可能是GPU。
可能是加速卡。
可能是一块8卡Board。
可能是一台Server。
可能是一整套Rack Reference Design。
甚至可能是一个针对特定模型优化的Inference Appliance。
重点不在于产品做得“大”。
重点在于:
必须把影响客户实际性能的关键瓶颈纳入自己的控制范围。
十三、AI芯片行业正在发生一次“产品单位”的重构
回看计算机产业历史,这其实不是第一次发生类似变化。
CPU时代,核心产品单位长期是一颗Processor。
云计算时代,产品单位变成Virtual Machine。
AI时代,产品单位正在再次变化。
对于芯片公司来说,它可能从:
GPU,
逐渐变成:
GPU Board,
再变成:
AI Server,
最终成为:
AI Rack。
对于云厂商和模型公司来说,真正购买的甚至已经不是Rack。
他们购买的是:
一个拥有确定Token产能的AI Factory。
这也是为什么下一代AI硬件真正重要的指标,很可能越来越不像传统半导体参数。
不是晶体管多少。
不是频率多少。
甚至不是FP4有多少PFLOPS。
而是:
一个Rack能产生多少Token?
一个MW能产生多少Token?
训练一个模型需要多少时间?
完成同一个任务需要多少美元?
整个集群一年能够保持多少有效利用率?
结语
所以,“下一代AI芯片公司的真正产品可能不是芯片”,并不是说芯片不重要。
恰恰相反。
芯片仍然是一切计算能力的物理基础。
但随着摩尔定律带来的单芯片收益越来越难独立转化成系统收益,竞争正在从:
Transistor Scaling
逐渐进入:
System Scaling。
过去半导体公司的核心能力,是把更多晶体管放进一颗芯片。
下一阶段AI计算公司的核心能力,可能变成:
如何让成千上万颗芯片、数十TB的HBM、数万个高速链路、上百MW的电力以及一整套软件系统,最终表现得像一台计算机。
所以GPU → Board → Server → Rack → Cluster,并不是简单的产品扩张。
它真正代表的是:
计算架构的边界正在不断向外移动。
而当竞争单位从Chip变成System之后,下一代AI芯片公司最终要回答的问题,也会发生变化。
过去的问题是:
“我的芯片有多快?”
未来的问题可能只有一个:
“在真实工作负载、真实功耗和真实成本下,我的整个系统究竟能产出多少有效智能?”
欢迎订阅我的博客
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.