去年9月,英伟达推出了Rubin CPX。这是一款专为大规模上下文推理而设计的新款GPU,也是英伟达第一款专为大规模上下文AI应用场景打造的CUDA GPU,其中模型可以同时对数百万个tokens进行推理。去年10月GTC DC 2025大会上展示的路线图里,还能看到Rubin CPX。不过到了今年3月的GTC 2026,展示的路线图包含了新发布的LP30 LPU及对应的Groq 3 LPX机架,而Rubin CPX却消失了。外界猜测,Rubin CPX的位置可能被LPU所取代。
据TECHPOWERUP报道,英伟达已经重新启动之前被搁置的Rubin CPX项目,打算更改设计后重新推出。在这次的新设计里,英伟达更改了DRAM架构,Rubin CPX将采用HBM4,而不是原来的GDDR7,容量从128GB增至168GB。
![]()
目前推理过程包括有上下文阶段和生成阶段两个截然不同的阶段,两者对基础设施的要求本质上完全不同。其中上下文阶段属于计算受限(compute-bound),需要高吞吐量的处理能力来摄取并分析大量输入数据,从而生成首个输出token;生成阶段则属于内存带宽受限(memory bandwidth-bound),依赖高速的内存传输和高带宽互联(比如NVLink),以维持逐个token的输出性能。
当前顶级GPU都是针对生成阶段的设计,不过在在解码阶段,HBM的作用没那么明显。英伟达原来打算在Rubin GPU旁边再加入Rubin CPX GPU,改用GDDR降低成本,通过分离处理两个阶段,可以更好地对计算和内存资源进行优化,从而显著提升算力的利用率。
Rubin CPX可提供30 PetaFLOPs的NVFP4算力,并集成了4个NVENC编码器和4个NVDEC解码器。改用HBM4之后,或许还要重新设计封装,换成台积电(TSMC)的CoWoS-S或CoWoS-L封装。未来Rubin CPX将安装在独立机架中,配置范围从64到256个GPU不等,英伟达建议与Rubin GPU保持1:1配比使用。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.