随手先关注,不错过每日AI热讯速递
①
MLPerf Inference v6.1 的结果在9 月 16 日公布,英伟达新一代Vera Rubin NVL72第一次出现在这份榜单上[1]。
新平台的成绩是Qwen3-VL上吞吐最高达到上一代GB300 NVL723.7 倍,覆盖 offline、server 与 interactive 三种场景,推理栈用的是 vLLM 与英伟达的 Dynamo[1]。
![]()
图:Vera Rubin NVL72 机架渲染图(来源:NVIDIA 官方博客[1])
②
这次成绩不是单一场景的数字。Qwen3-VL上的最高结果是3.7 倍,覆盖 offline、server 与 interactive 三档场景[1]。
DeepSeek-R1那一次用的是TensorRT-LLM库,吞吐最高为 GB300 NVL72 的2.5 倍[1]。
![]()
图:性能对比表,列出 DeepSeek-R1 与 Qwen3-VL 在三档场景下相对 GB300 NVL72 的倍数(来源:NVIDIA 官方博客[1])
③
扩展效率(加卡之后吞吐的实际增长比例,越接近 100% 说明设备加得越划算)是另一组更有分量的数字[1]。
GB300 NVL72 把 DeepSeek-R1 从单机架72 块 GPU扩到四机架288 块,offline 吞吐近乎线性增长,扩展效率报出99%[1]。
越接近满值,加卡带来的吞吐损耗就越小。是否要继续堆卡,正是超大规模集群算成本账时最难受的那道题。
软件也在贡献性能。从 v6.0 到 v6.1,光是软件优化就让 GB300 NVL72 在 Qwen3-VL 上提升最多1.6 倍[1]。
提升来自更低的KV cache(推理时缓存历史键值对的内存区,占用越大越挤占显存)精度、更多 kernel fusion 与更好的算子[1]。
解耦式服务与 vLLM、Dynamo 的配合也是其中一项来源[1]。
![]()
图:扩展效率表,对比 GB300 NVL72 单机架 72 块 GPU 与四机架 288 块 GPU 的 offline 吞吐(来源:NVIDIA 官方博客[1])
④
把三组数字放在一起,指向同一条主线:推理经济学。同样的供电与机柜能吐出多少 token,决定了数据中心这笔账算不算得过来。
面向智能体的负载上,Vera Rubin NVL72 在 SemiAnalysisAgentX的预览测试中达到 GB300 NVL72 的30 倍[1]。
文生视频基准WAN 2.2上,GB300 NVL72 达到每秒0.65 个 720p 视频、单个视频5.7 秒,吞吐是单节点的9 倍,延迟低7.5 倍[1]。
互联层面,第六代NVLink与 NVLink Switch 提供10 倍包速率、比通用以太网低3 倍延迟[1]。
本轮提交里有19 家伙伴参与,其中8 家跑在多节点 Blackwell NVL72 系统上[1]。边缘侧英伟达用Jetson AGX Thor提交了新增的 Edge-Agentic 基准,模型是Qwen3.6-27B[1]。
![]()
图:软件优化结果表,标注 GPT-OSS-120B 与 DLRMv3 在 B300x8、B200x8 上的 offline 与 server 吞吐(来源:NVIDIA 官方博客[1])
有一件事需要说清楚:这是预览提交,不是量产配置的最终成绩。硬件与软件都还在收敛,后续数字可能变化[1]。
英伟达公布的对比表里,各档场景取的是最高值,不是全场景平均值,这个需要注意一下[1]。
英伟达同时表示,v6.1 提交截止之后仍在继续做软件优化,GPT-OSS-120B 与 DLRMv3 上又有一轮提升。但那批数字尚未经过 MLCommons 验证,不能与榜单成绩等同看待[1]。
MLCommons 已经在预告MLPerf Endpoints基准,准备把智能体推理纳入标准化测量[1]。
推理成本能不能继续往下走,取决于两件事:单机性能,和加卡之后的效率。
你觉得这一轮算力迭代里,真正卡住落地的是芯片、电力,还是能把新硬件喂饱的软件?欢迎在评论区分享你的判断。
参考来源:
[1] NVIDIA Blog: NVIDIA Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debuthttps://blogs.nvidia.com/blog/vera-rubin-nvl72-mlperf-inference/
欢迎点赞、分享、推荐
一起拥抱AI
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.