网易首页 > 网易号 > 正文 申请入驻

英伟达AI工厂性能揭晓:100MW功耗、2ZFLOPS推理算力,单机DeepSeek吞吐量暴增至30倍

0
分享至


芯东西(公众号:aichip001)
编译 崔嫄伟
编辑 陈骏达

芯东西9月1日消息,在2026年全球顶级半导体架构行业研讨会Hot Chips上,英伟达正式揭晓Vera Rubin平台旗下新一代数据中心AI加速器Rubin GPU的完整技术细节。

英伟达首次披露Rubin GPU对应的工厂级满配性能指标。所有数据均针对100MW级AI工厂整体系统,而非单块GPU:NVFP4精度下推理性能达2ZFLOPS,训练性能达1.4ZFLOPS;配套11PB HBM4高带宽内存,内存总带宽达800PB/s,整套AI工厂系统功耗为100MW。


英伟达引用SemiAnalysis测试数据验证,在搭载140K+超长上下文的DeepSeek-v4-PRO模型、AgentX智能体工作负载下,Vera Rubin NVL72在60M总token处理规模后性能全面超越前代GB300 NVL72;且随着Agentic AI多轮推理、工具调用等高交互任务复杂度提升,其每兆瓦token吞吐可实现10倍提升,最高可达30倍。


一、Rubin GPU:面向Agentic AI的全栈重构

Vera Rubin被英伟达定位为全栈AI工厂平台,覆盖7类芯片与5种机架规格。平台不仅整合了Vera CPU、Rubin GPU、BlueField-4数据处理器、Spectrum-6交换芯片,还集成了Groq语言处理单元(LPU),在上层构建了存储、网络、工具调用与沙箱运行的完整支撑体系。对Agentic AI而言,从超长上下文窗口、大容量内存到高速扩展互联架构,每一层硬件资源都是支撑多轮推理的必要基础。

在以“每兆瓦token”为纵轴、交互性为横轴的性能坐标系中,Vera Rubin NVL72机架的表现大幅领先Blackwell NVL72,更远超Hopper架构的NVL8世代(对应HGX H100/H200 8-GPU服务器),尤其在高交互智能体场景下优势显著。


与之对应的是设计优化目标的转向:每瓦token数、首token生成时间(TTFT)、有效使用寿命、平均中断间隔时间四大指标的优先级,已经超过了传统的原始浮点运算速度(FLOPS)。Agent时代,平台的长期收益与持续产出能力,比峰值算力更重要。


二、核心技术:稀疏计算与互联升级

随着AI Agent每轮交互的上下文长度不断增长,注意力计算量呈平方级上升,一轮长时会话的前馈与注意力计算量远超40万token规模。英伟达称,单纯为GPU堆砌数学运算单元已不足以应对这一挑战,因此从计算效率、多卡同步、集群互联三个维度重构了技术栈。

计算效率层面,Rubin GPU采用自适应稀疏技术,搭配硬件管控的混合精度运算,为低精度运算配备专属硅片资源,同时结合结构化稀疏与精度保留压缩技术,覆盖训练与推理场景。

Rubin的自适应稀疏技术以2:4稀疏格式为基础,并实现了更灵活的动态判断能力,稀疏机制贯穿整个Transformer模块:在QKV矩阵、注意力投影层与MLP多层感知机中,硬件自动识别并跳过接近零的无效数值计算,在不改变模型结构的前提下降低运算量。英伟达称,绝大多数预训练模型无需修改或微调,仅需在推理运行时通过参数即可开启该功能。


为验证稀疏模式的精度保留能力,英伟达分别以BF16稠密模式与NVFP4稀疏模式运行Qwen-Image图像生成模型,生成同一场景的电影感肖像,视觉效果几乎一致。


多个硬件基准测试数据同样显示,稀疏模式在各类评测集上的精度表现与稠密模式基本持平。


分布式推理场景下,多GPU间的同步延迟是制约高交互场景吞吐量的核心瓶颈。Rubin GPU重构了多卡同步逻辑,用计数写入(Counted-Write)机制替代传统的内存屏障(MEMBAR)方案。传统Blackwell架构依靠内存屏障保证数据写入完成,再通过更新原子标志位、接收端轮询查询的方式实现同步,轮询过程会持续占用互联带宽与计算资源。


而计数写入机制由发送端附带数据计数信息,接收端依靠片上硬件计数器统计接收进度,计数达标后硬件自动触发后续计算,彻底消除了轮询开销与内存屏障带来的延迟,大幅降低NVLink交互延迟,在高交互智能体场景下显著提升系统吞吐量。

集群互联层面,第六代NVLink是提升token吞吐的另一核心支柱。作为英伟达专属的GPU间高速互联总线,第六代NVLink构建起最多72块GPU的统一扩展域,单卡全互联带宽达3.6TB/s。相比传统以太网扩展方案,NVLink 6实现4倍吞吐量提升、3倍延迟降低、10倍数据包速率提升,同时交换托盘硬件自带130TFLOPS的网内计算能力,可在数据转发途中完成聚合运算,减少数据往返搬运。


NVL72机架依托NVLink 6交换托盘,实现整个扩展域内所有GPU的硬件级缓存一致性,对上层软件而言,72块GPU可等效为一块巨型虚拟GPU,大幅简化分布式训练与推理的部署复杂度。

三、系统级创新:供电、散热与可靠性

在芯片技术之外,英伟达推出第三代MGX开放机架平台,从系统层面进一步释放AI工厂的能效与可靠性潜力。作为英伟达模块化加速计算的开放标准,MGX生态目前已拥有80余家合作伙伴,在全球30个国家、350多个工厂站点具备数百万平方英尺的产能。

NVL72机架采用45℃高温进水液冷、800V直流供电架构,搭配无重定时器设计,支持热插拔、无电缆托盘与铜缆扩展架构,全方位提升首token时间与平均中断间隔指标。其中Vera Rubin计算托盘采用无电缆、无风扇设计,去除了托盘内部的连接线与散热风扇,大幅简化机架级部署与运维流程,同时降低单点故障风险。

散热体系上,英伟达采用温水冷却方案,通过提升进水温度至45℃,拉大冷却液与环境的温差,多数场景下可省去冷水机组与配套水损耗,在保证满负载性能的同时,降低制冷系统的能耗占比,让更多电力预算用于算力输出。

供电系统是英伟达挖掘能效潜力的关键一环。NVL72搭载智能功率平滑技术,通过硬件与算法动态平抑负载的功率波动,削峰填谷降低峰值功耗。官方数据显示,在大语言模型训练场景下,单座Vera Rubin NVL72机架可实现峰值功耗降低13%,同时提升电网合规性;结合其他系统级功耗优化,每瓦供电容量可支撑的GPU数量最多提升40%,相当于在同等供电基础设施下部署更多算力。


可靠性方面,英伟达第二代RAS引擎(RIST,可靠性、可用性与可维护性引擎)支持工作负载运行时的零停机GPU健康检查,搭配进阶版SRAM ECC纠错机制与增强型NVLink热交换服务。不同于第一代RAS需要整个节点离线数小时完成检测,第二代引擎可在业务不中断的情况下完成健康巡检,直接提升系统有效吞吐量,同时为预测性维护提供数据支撑。

结语:算力交付范式转向:从芯片单元到百兆瓦AI工厂

整场发布会中,英伟达将Rubin GPU纳入AI工厂完整体系架构,作为系统核心计算层级。该平台整合计算、网络、供电、散热、运维服务的全链路基础设施能力。

Rubin GPU的落地,折射出英伟达算力产品战略的关键升级。产品价值维度从传统浮点运算峰值性能,延伸至全生命周期运行效率与整体拥有成本。行业传统算力交付单位集中于单GPU、单服务器级别,英伟达则将产品交付尺度升级至100MW级大型AI工厂。

当前行业不少产品宣传依旧以单芯片峰值算力作为主要衡量标尺,而Vera Rubin平台将评估维度拓展至数据中心整体可用性与持续产出能力,依托整套工厂级基础设施体系,实现规模化、高可靠的稳态算力输出。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
陈熠输给张本美和!46岁前国乒名将现场生气发抖 被送速效救心丸

陈熠输给张本美和!46岁前国乒名将现场生气发抖 被送速效救心丸

念洲
2026-09-16 10:04:11
Claude独立破译370年前密文!仅44分钟,密码学家破防了

Claude独立破译370年前密文!仅44分钟,密码学家破防了

新智元
2026-09-15 13:11:38
马雷斯卡:当年曼联千里护球咋没人道歉?

马雷斯卡:当年曼联千里护球咋没人道歉?

体坛周报
2026-09-16 18:32:19
激烈碰撞!中东再传巨响,美伊战局重大逆转 !

激烈碰撞!中东再传巨响,美伊战局重大逆转 !

大嘴说天下
2026-09-16 20:06:37
汪峰把公司1100人砍到400人,700人被裁。他说:“引入AI两个月,剩下400人干得比原来还好”,财务笑开了花。

汪峰把公司1100人砍到400人,700人被裁。他说:“引入AI两个月,剩下400人干得比原来还好”,财务笑开了花。

LULU生活家
2026-08-15 14:17:30
中国电网负债3万亿,外媒称百年难回本

中国电网负债3万亿,外媒称百年难回本

梦想的现实
2026-07-01 01:11:56
王宇燕,高票当选

王宇燕,高票当选

政知新媒体
2026-09-16 12:48:47
血赚 1 亿!阿森纳世界级天才一战封神!阿尔特塔挖到宝了

血赚 1 亿!阿森纳世界级天才一战封神!阿尔特塔挖到宝了

奶盖熊本熊
2026-09-16 07:37:30
鸭蛋被关注!研究发现:吃得越多,肌少症老年人肌肉流失或越慢?

鸭蛋被关注!研究发现:吃得越多,肌少症老年人肌肉流失或越慢?

牛锅巴小钒
2026-09-16 12:36:43
460万粉车评大 V “拜托了老司机” 被封!汽车圈为什么接连翻车?

460万粉车评大 V “拜托了老司机” 被封!汽车圈为什么接连翻车?

沙雕小琳琳
2026-09-16 05:53:29
萧华:若我们没能把开拓者留在波特兰,我会认为那是一种失败

萧华:若我们没能把开拓者留在波特兰,我会认为那是一种失败

懂球帝
2026-09-16 07:51:35
曼联官方:3名青训球员签下职业合同

曼联官方:3名青训球员签下职业合同

懂球帝
2026-09-16 17:55:39
这不是表彰而是虚假宣传!中南大学教师节大翻车,校方紧急自救

这不是表彰而是虚假宣传!中南大学教师节大翻车,校方紧急自救

平老师666
2026-09-16 16:04:49
菲律宾前总统杜特尔特在海牙国际刑事法院出席庭审

菲律宾前总统杜特尔特在海牙国际刑事法院出席庭审

新京报
2026-09-16 16:53:44
iPhone Duo只是开始,苹果折叠屏路线图曝光:Duo Max、翻盖Mini、第三代上Face ID

iPhone Duo只是开始,苹果折叠屏路线图曝光:Duo Max、翻盖Mini、第三代上Face ID

科技兽
2026-09-14 22:32:04
高晓松要拍《林徽因传》,被梁再冰警告:“你要是拍我妈和徐志摩的感情线,我告你破产!”高晓松满脸不快

高晓松要拍《林徽因传》,被梁再冰警告:“你要是拍我妈和徐志摩的感情线,我告你破产!”高晓松满脸不快

背包旅行
2026-09-15 10:01:19
争议拉满,6.83亿元标王水土不服,名宿直言吉马良斯或将沦为遗憾

争议拉满,6.83亿元标王水土不服,名宿直言吉马良斯或将沦为遗憾

李健政观察
2026-09-15 22:51:24
匿名现役美国军人首次公开中东多处美军基地遭伊朗袭击照片:建筑与装备大面积损毁,“我们眼睁睁看着它们被摧毁,任由别人往脸上挥拳”

匿名现役美国军人首次公开中东多处美军基地遭伊朗袭击照片:建筑与装备大面积损毁,“我们眼睁睁看着它们被摧毁,任由别人往脸上挥拳”

政知新媒体
2026-09-16 08:30:59
中方宣布:阿莫林将访华

中方宣布:阿莫林将访华

政知新媒体
2026-09-15 15:14:00
两性心理学:同房时真正生理性喜欢,不是接吻,不是拥抱,而是这种感觉

两性心理学:同房时真正生理性喜欢,不是接吻,不是拥抱,而是这种感觉

心理观察局
2026-09-14 06:16:07
2026-09-17 00:00:49
芯东西 incentive-icons
芯东西
智东西AI媒体矩阵品牌。芯东西,芯片产业新媒体。我们是一群追芯人,专注报道AI芯片和半导体产业创新。
2599文章数 8161关注度
往期回顾 全部

科技要闻

赛力斯接管问界,撑得住华为给的身价吗?

头条要闻

父亲遛狗2岁娃独留家中从18楼坠亡 父亲发声:我很愧疚

头条要闻

父亲遛狗2岁娃独留家中从18楼坠亡 父亲发声:我很愧疚

体育要闻

对话西甲联盟高管:西班牙足球到底强在哪?

娱乐要闻

乔任梁去世十周年,陈乔恩悼念

财经要闻

邢自强:中美AI决胜点不在算力

汽车要闻

全场景智能豪华SUV 奔驰长轴距GLE上市 59.98万起

态度原创

教育
本地
旅游
公开课
军事航空

教育要闻

“做中学”!北京各校这样上好科学课

本地新闻

不止胖东来!许昌藏着半部三国史

旅游要闻

现实版“千里江山图”走红半年后,雅安如何把“网红”变“长红”?

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

中东美军基地遭伊朗袭击后照片被披露

无障碍浏览 进入关怀版