大模型推理的速度瓶颈,很多时候不在算力,而在数据搬运。Cerebras联合创始人兼CEO Andrew Feldman在播客里给出了一个数字:在LLM推理环节,他们的晶圆级架构比GPU快2500倍。
这个倍数不是算力堆出来的,而是内存位置换来的。
![]()
推理分两步,慢的那步在搬数据
Feldman把推理拆成两个阶段。第一阶段是pre-fill,模型先处理用户输入的提示词;第二阶段是decode,模型一个token接一个token地按顺序生成答案。
慢就慢在decode。每算出一个token之前,模型权重都必须从内存搬到计算单元。这个动作要重复成千上万次,token一个一个来,搬运也就一次一次发生。
GPU上,这些权重是从HBM搬出来的。Cerebras的做法不同,它把权重留在SRAM里,而这些SRAM分布在一块面积非常大的晶圆级处理器上。
2500倍差在哪
SRAM比HBM快得多,这是硬件层面的差异。当权重不用从HBM出发、而是从遍布晶圆的高速SRAM里取用时,每个token都要发生的那次"内存到计算"的搬运,速度大约快了2500倍。
换句话说,Cerebras没有在算力上硬拼,而是把权重放到了离计算更近的地方。搬运距离缩短,单次token生成的等待时间就跟着缩短。
这个解释来自The MAD Podcast with Matt Turck与Cerebras YouTube频道的对话。Feldman在节目里把2500倍这个数字的来龙去脉讲得很直白:不是芯片算得更快,是数据走的路更短。
为什么这件事值得关注
推理成本正在成为大模型落地的主要开销。decode阶段是逐token串行进行的,任何一次搬运的延迟都会被放大到整个生成过程里。
把权重常驻在SRAM、摊在一整片晶圆上,等于绕开了HBM这条必经之路。Feldman给出的2500倍,针对的正是这个环节。
对于关心推理效率的人来说,这个数字提供了一个不同于"堆更多GPU"的思路:先看数据从哪里来,再看算力够不够。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.