峰值FLOPS越来越难解释真实竞争力
写给AI芯片公司CEO、CTO、架构师和产业投资人的一篇系统分析
开篇:AI芯片行业正在进入一个危险的误判周期
过去十年,半导体行业形成了一套非常成熟的性能评价体系:
晶体管数量更多;
制程节点更先进;
频率更高;
TOPS/FLOPS更大。
在CPU时代,这套逻辑长期有效。
因为CPU执行的大部分任务,本质上受单核性能、缓存效率和指令吞吐影响。
但AI计算正在改变这个游戏规则。
今天,一颗AI芯片标称:
1000 TFLOPS FP16;
2000 TOPS INT8;
10 PFLOPS FP4;
并不能回答最重要的问题:
它到底能让一个真实模型更快训练多少?能让多少用户同时推理?每个token成本是多少?每瓦产生多少有效智能?
这也是为什么AI芯片竞争正在从:
谁的峰值算力最高
转向:
谁能把计算、内存、通信、软件和数据中心组合成最高效率的AI系统。
峰值FLOPS正在成为类似汽车发动机排量的指标。
它仍然重要。
但它越来越不能代表整车性能。
一、问题是什么:为什么峰值FLOPS正在失去解释力? 原始问题:
AI模型的计算需求增长速度超过单芯片能力增长。
于是产业采用两个方向:
第一,提高单芯片算力。
第二,把更多芯片连接起来。
这产生了一个表面矛盾:
芯片越来越强。
但系统效率提升越来越困难。
原因是什么?
因为AI计算已经从:
计算问题
变成:
数据移动问题。
传统计算:
Memory → CPU → Result路径相对简单。
现代大模型:
HBM
↓
Tensor Core
↓
Cache
↓
NVLink/ICI
↓
Other Accelerator
↓
Network
↓
Other Node
↓
Storage计算单元只是其中一个环节。
任何一个环节不足,峰值计算都会浪费。
Google Cloud在介绍AI加速器性能分析时,也明确指出AI加速器性能主要受三个因素约束:
计算能力;
HBM等内存带宽;
芯片间网络带宽。
也就是典型Roofline模型:
FLOPS只是性能上限,不是实际性能。 ([Google Cloud Documentation][1])
二、第一个误区:峰值性能 ≠ 有效性能 1. 为什么芯片厂商喜欢宣传峰值?
因为峰值容易比较。
例如:
A芯片:
20 PFLOPS FP8
B芯片:
15 PFLOPS FP8
看起来A一定更强。
但真实AI workload中,需要回答:
Matrix Multiply占多少?
Memory Access占多少?
Communication占多少?
Kernel是否融合?
Batch size是多少?
模型是否稀疏?
Precision是否可用?
假设:
芯片A:
100单位计算能力
10单位内存带宽
芯片B:
70单位计算能力
20单位内存带宽
如果任务是:
大型矩阵乘法:
A可能领先。
如果任务是:
LLM Decode:
B可能反超。
因为Decode通常受:
KV Cache;
HBM bandwidth;
memory latency
限制。
所以今天AI芯片真正应该比较的是:
Effective Performance=
Peak Compute
×
Memory Utilization
×
Communication Efficiency
×
Software Utilization
而不是:
Peak FLOPS三、第二个误区:单卡性能 ≠ 集群性能
AI时代最大的变化:
计算单位从芯片变成集群。
过去:
一颗CPU性能决定服务器。
今天:
10000颗AI accelerator如何协同决定竞争力。
为什么?
因为大模型训练已经进入:
Tensor Parallel;
Pipeline Parallel;
Data Parallel;
Expert Parallel。
尤其MoE模型。
MLPerf Training v6.0已经加入DeepSeek V3等MoE训练基准,并出现更多硬件和系统参与,反映训练竞争正在从单纯密集计算转向复杂系统效率竞争。([MLCommons][2])
假设:
芯片A:
单卡性能高20%。
但是:
通信效率低;
Collective效率差;
软件优化不足。
芯片B:
单卡弱。
但是:
scale-up效率高;
集群利用率高。
最终:
B可能完成训练时间更短。
成立条件
这个判断成立,需要:
模型规模足够大;
通信比例足够高;
集群规模足够大。
系统优化越来越复杂:
需要:
网络工程;
编译器团队;
Runtime团队;
分布式训练专家。
如果未来模型越来越小:
例如:
边缘模型;
端侧模型;
单机Agent。
那么单芯片效率重新重要。
四、芯片架构:从通用计算走向领域专用 原始约束:
AI工作负载高度变化。
今天:
Transformer。
明天:
MoE。
后天:
Agent。
所以芯片必须面对:
灵活性 vs 效率
的矛盾。
GPU为什么成功?
不是因为GPU每个指标最好。
而是:
它提供:
大规模并行;
可编程性;
成熟软件生态。
因为大量AI计算已经稳定。
例如:
推荐系统;
广告排序;
固定推理服务。
这些任务:
模型固定;
数据固定;
优化空间明确。
补偿方式:
ASIC删除通用性。
换取:
更高能效;
更低成本;
更高吞吐。
失去:
软件适应性;
模型迁移能力;
生命周期弹性。
AI变化速度超过芯片生命周期。
一颗ASIC设计周期:
2-4年。
模型变化:
可能半年。
因此:
未来不是GPU消失。
而是:
GPU内部越来越ASIC化。
ASIC越来越系统化。
两者融合。
五、HBM:AI竞争正在进入内存时代 原始约束:
计算增长速度超过数据供给速度。
Tensor Core越来越快。
但数据进不来。
于是瓶颈从:
Compute Wall
变成:
Memory Wall。
HBM解决什么?
不是提高计算。
而是:
提高数据搬运能力。
现代AI芯片竞争:
已经不是:
“多少核心?”
而是:
“多少数据可以快速进入核心?”
NVIDIA Blackwell平台就是典型例子。
其GB200 NVL72系统设计重点不仅包括Tensor Core,也包括:
HBM;
NVLink;
大规模系统互联。
官方规格显示,GB200 NVL72通过NVLink连接72个GPU,并强调大规模训练和推理系统能力。([NVD Orangelogic][3])
但HBM不是免费午餐。
代价:
第一:
成本。
HBM供应受到:
TSV;
堆叠良率;
先进封装。
限制。
第二:
功耗。
高速Memory Interface消耗巨大能源。
第三:
供应链。
HBM已经成为AI芯片供应链关键瓶颈。
瓶颈迁移:
解决Compute问题。
转移到:
Memory Capacity问题。
解决Bandwidth问题。
转移到:
封装问题。
六、先进封装:摩尔定律后的新战场 原始约束:
传统Scaling越来越困难。
先进制程:
成本增加;
良率下降;
设计复杂。
产业开始转向:
Chiplet。
Chiplet优势:
把系统拆开:
Compute Die
Memory
IO
Networking
分别优化。
但Chiplet不是免费提升。
它增加:
封装复杂度;
Die-to-Die通信;
热设计难度;
测试复杂度。
最大的挑战:
不是做出来。
而是:
大量可靠生产。
技术可行:
存在。
产品可用:
需要:
良率;
测试;
成本。
需要:
供应链成熟。
七、互联:AI系统正在从“芯片竞争”变成“网络竞争”
未来最大的竞争单位:
不是GPU。
是AI Factory。
因为:
10000颗芯片如果不能有效通信,
等于10000个孤岛。
互联分两个层:
Scale-up
芯片内部高速连接。
目标:
让多个芯片像一个巨大芯片。
Scale-out
数据中心网络。
目标:
让多个节点协同。
NVIDIA持续强化NVLink和网络产品,本质上就是把竞争从GPU延伸到整个AI基础设施。GB200 NVL72等系统已经把高速GPU互联作为核心设计元素。([NVD Orangelogic][3])
开放互联的挑战
很多人认为:
开放标准出现。
NVIDIA优势消失。
这是过度简化。
协议只是开始。
真正需要:
PHY;
Switch;
软件栈;
Collective Library;
调试工具。
互联生态成熟需要时间。
八、软件栈:未来最大的隐藏护城河
很多芯片公司低估一个事实:
AI芯片不是硬件产品。
它是软件产品。
完整链路:
Framework
↓
Compiler
↓
Runtime
↓
Kernel
↓Hardware
如果硬件性能100。
软件利用率50%。
实际只有50。
优秀硬件:
需要:
自动调优;
Kernel优化;
Graph compiler;
Memory scheduling。
CUDA今天的重要性:
不是API。
而是:
20年的软件资产。
未来挑战:
如果Compiler越来越成熟:
硬件差异会被隐藏。
但这个过程很慢。
因为:
软件生态具有路径依赖。
九、Runtime和Kernel:决定最后30%的性能
很多芯片在实验室性能很好。
进入真实模型:
性能下降。
原因:
不是芯片。
而是:
Kernel。
AI模型越来越复杂:
Flash Attention;
MoE routing;
Quantization;
Fusion;
Dynamic batching。
芯片架构必须围绕软件共同设计。
未来优秀AI芯片团队:
不会只有:
RTL工程师。
必须同时拥有:
Compiler专家;
Framework专家;
Model专家。
AI计算最大的限制:
可能不是晶体管。
而是电力。
假设:
芯片性能提升。
但是:
机架功耗翻倍。
那么:
数据中心规模无法扩张。
未来竞争指标:
不是:
PFLOPS。
而是:
tokens / kWh
tokens / dollar
tokens / rack
十一、系统TCO:最终商业胜负手
芯片公司容易犯一个错误:
证明:
“我的芯片更快。”
客户真正关心:
“我的AI服务成本是否下降?”
TCO包括:
硬件
芯片;
HBM;
服务器。
软件
迁移;
维护。
数据中心
电力;
冷却;
空间。
运营
可靠性;
调度;
故障恢复。
一颗芯片:
性能领先20%。
如果:
软件迁移成本巨大。
可能没有商业价值。
十二、AI芯片公司的产品定义应该如何改变?
未来芯片定义不能从:
“多少TOPS”
开始。
应该从:
第一层:
目标模型。
训练?
推理?
Agent?
第二层:
目标指标。
不是:
FLOPS。
而是:
tokens/s;
tokens/W;
tokens/$;
time-to-train。
系统边界。
卖:
芯片?
还是:
服务器?
还是:
完整AI Factory?
第四层:
软件战略。
有没有:
Compiler?
Runtime?
Developer ecosystem?
十三、未来竞争格局:三个判断判断一: 算力仍重要,但只是进入系统竞争的门票。
成立条件:
模型规模继续增长。
证伪:
模型效率大幅提升。
判断二: HBM和互联重要性会超过单纯计算核心数量。
成立条件:
大模型继续受memory和communication限制。
证伪:
算法革命显著降低数据移动。
判断三: AI芯片公司最终竞争的是系统能力。
成立条件:
客户越来越购买集群。
证伪:
大量AI回到端侧、小模型。
十四、给产业投资人的三个提醒 第一:
不要只看TOPS。
看:
有效利用率。
第二:
不要只看芯片。
看:
软件团队。
第三:
不要只看Demo。
看:
规模部署。
很多技术:
可以Demo。
但不能量产。
很多芯片:
可以量产。
但不能形成生态。
很多生态:
可以形成。
但无法盈利。
结论:
AI芯片竞争的核心已经发生变化。
过去:
制程决定芯片。
今天:
架构决定芯片。
未来:
系统决定芯片。
峰值FLOPS不会消失。
它仍然代表潜在能力。
但未来赢家不会是:
拥有最高峰值算力的公司。
而是:
能够把:
计算、
内存、
互联、
封装、
软件、
能源、
供应链、
工程组织
组合成最高系统效率的公司。
AI时代真正的芯片竞争,不是制造更强的计算单元。
而是制造更高效率的智能基础设施。
从“芯片设计竞争”,走向“AI系统工程竞争”,这才是下一阶段半导体产业最大的变化。
[1]: https://docs.cloud.google.com/docs/ai-ml/accelerator-performance-benchmarking?utm_source=chatgpt.com "AI accelerator performance and benchmarking | Generative AI | Google Cloud Documentation"
[2]: https://mlcommons.org/2026/06/mlperf-training-v6-0-results/?utm_source=chatgpt.com "MLPerf Training v6.0 Results: New MoE Benchmarks and Record System Diversity | MLCommons"
[3]: https://dam-cdn.nvd.orangelogic.com/AssetLink/y441155802qub41q118b2852i557jem5.pdf?utm_source=chatgpt.com "Datasheet for NVIDIA Blackwell Architecture | NVIDIA"
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.