网易首页 > 网易号 > 正文 申请入驻

英伟达Vera Rubin首秀,DeepSeek V4 Pro 跑出30倍Agent吞吐

0
分享至

机器之心编辑部


过去几年,AI 基础设施的竞争核心是 GPU。更大的模型、更高的参数规模、更强的推理能力,都推动着数据中心不断堆叠 GPU。

但随着 AI Agent 开始执行越来越复杂的任务,新的计算需求出现。一个 Agent 不再只是完成一次模型推理,它需要持续规划任务、调用工具、执行代码、处理数据,并在多个步骤之间保持上下文。

根据 NVIDIA 引用的 OpenRouter 数据,真实 AI 流量中平均 Prompt 长度已增长约 4 倍,单次 Agentic 请求消耗的 token 数量最高可达普通聊天请求的 15 倍。这意味着,AI 系统需要的不只是更强的模型,也需要一套专门支撑 Agent 运行的计算架构。

就在今天早上,NVIDIA 首次公布了基于真实芯片的 Vera Rubin 性能测试结果。

在针对 Agent 工作负载的测试中,Vera Rubin 相比上一代 GB300 NVL72 最高实现每兆瓦吞吐提升 30 倍,并将 token 成本最高降低 35 倍。



就在同一时间,SpaceXAI 宣布将部署 NVIDIA Vera CPU,并计划基于 Vera Rubin 架构扩展支撑 Grok 的 AI 基础设施,进一步探索将优化后的 Vera Rubin NVL72 系统部署到轨道计算环境。



从 Agent 性能测试,到 SpaceX 的轨道计算探索,NVIDIA 展示了一个新的方向:未来 AI 竞争的关键,不只是模型能力,还有支撑 Agent 持续行动的计算基础设施。

Vera Rubin 首次面向 Agent 工作负载测试

过去的大模型性能测试,更多关注固定输入长度下的推理速度。但 AI Agent 改变了这一标准。衡量 Agent 基础设施能力,不能再依赖传统的固定 Prompt 测试,而需要接近真实生产环境的工作负载。这也是 NVIDIA 此次测试的重点。

NVIDIA 采用SemiAnalysis 的 AgentX 工作负载,对 Vera Rubin NVL72 的 Agent 性能进行评估。AgentX 是一个面向 Agentic Coding Inference(智能体代码推理)的基准测试,通过回放真实生产风格的 Agent 会话,评估计算系统处理真实 Agent 请求的能力。



智能体(Agent)会话会产生动态变化的推理序列。

与传统聊天任务不同,Agent 会话具有明显的长链路特征:一次任务中可能包含连续的模型调用、工具使用以及不断累积的上下文。AgentX 会保留原始任务中的上下文长度、输入输出序列、推理时间以及工具调用延迟,以模拟真实 Agent 运行状态。

例如,一个代码 Agent 完成开发任务时,可能需要理解需求、分析代码库、修改程序、执行测试,并根据测试结果继续调整方案。随着任务推进,系统不仅需要处理更长的上下文,还需要持续复用此前已经处理的信息。

NVIDIA 展示的一条真实 Agent 轨迹中,主 Agent 的上下文可以从约 6 万 token 一路增长到接近 40 万 token,同时穿插多个子 Agent 请求。也就是说,对 Agent 而言,「长上下文」是在任务推进过程中自然形成的运行状态,而非偶尔出现的极端情况。



NVIDIA 将这样的指标定义为 AI 工厂级的「每兆瓦吞吐量」(tokens per megawatt)。AgentX 同时关注吞吐效率、端到端延迟、首 token 时间等指标,以衡量系统是否能够在高效率下保持良好的交互体验。

在测试中,NVIDIA 使用 DeepSeek V4 Pro 模型运行 AgentX 工作负载。结果显示,在每位用户 160 tokens/s 交互目标下,Vera Rubin NVL72 相比 GB300 NVL72 最高实现 30 倍更高的 AI 工厂级每兆瓦吞吐量,意味着在相同能源预算下,可以支撑更多 Agent 推理任务。



NVIDIA 将 Vera 定义为「首款为 AI Agent 打造的 CPU」。它采用 88 个 NVIDIA 设计的 Olympus 核心,并搭载高带宽 LPDDR5X 内存,最高提供 1.2TB/s 内存带宽。

当然,Vera 并不是要替代 GPU,它在 AI 系统中承担新的角色:GPU 继续负责大规模模型计算,Vera 则负责支撑 Agent 运行过程中的任务调度、代码执行和数据处理。

30 倍从哪里来?

如果只把 30 倍归因于 Rubin GPU 本身,就会低估 Vera Rubin 真正发生的变化。NVIDIA 此次展示的性能,本质上是一项 rack-scale system result,而不是单颗 chip result。



Agent 运行到后期,会不断处理越来越长的上下文。推理系统不仅需要执行 Transformer 计算,还必须高效保存和复用 KV Cache,并在不同 GPU 之间交换模型专家、上下文状态和中间结果。随着上下文长度、用户交互速度和并发规模不断提高,瓶颈也开始从单纯的 GPU 算力扩展到内存、通信、缓存管理和系统调度。

为此,Vera Rubin NVL72 将 Rubin GPU、HBM4、NVLink 6 以及新的推理软件栈放在一起进行协同设计。Rubin 单 GPU 配置 288 GB HBM4,内存带宽达到 22 TB/s;NVLink 6 则为单 GPU 提供 3.6 TB/s scale-up 双向带宽。对于 72 颗 GPU 组成的 NVL72 而言,更大的统一 scale-up domain 能够让 MoE 专家并行、分布式 KV Cache 等机制在整个机架内运行。

软件层面的变化同样重要。NVIDIA 列出的关键机制包括 Prefill/Decode 分离、Distributed KV Cache、KV Cache offloading、KV-aware routing 以及大规模 Expert Parallelism。

以 KV-aware routing 为例,当一个 Agent 再次发起请求时,系统可以尽量将任务路由到已经保存对应上下文缓存的 GPU,从而避免重新计算此前处理过的大量 token。对于上下文可能持续增长到几十万 token 的 Agent 而言,这种缓存复用会直接影响吞吐、延迟以及每个 token 的实际成本。

换句话说,Rubin 真正升级的并不只是一颗 GPU,而是一条完整的「token 生产流水线」:从读取长上下文、执行模型,到交换 KV Cache 和 MoE 专家,再到持续生成 token,每一层都会共同决定最终能够服务多少 Agent。

而 NVIDIA 还在进一步拆分这条 token 生产流水线。

就在公布 Vera Rubin Agent 性能测试的同一天,NVIDIA 宣布 Groq 3 LPX 进入全面量产,并将其纳入 Vera Rubin 平台。Groq 3 LPX 被定位为面向交互式 AI 的低延迟推理加速器,它并不是替代 Rubin GPU,而是针对 Agent 推理中另一类计算特征进行专门优化。

大模型推理通常可以粗略分成两个阶段:首先是 Prefill,即读取和处理 Prompt 以及已经积累的大量上下文;随后是 Decode,即模型一个接一个地生成新的 token。

对于拥有几十万 token 上下文的 Agent 而言,这两个阶段对硬件的要求并不相同。Prefill 需要较高的计算能力和内存吞吐,而 Decode 则更加关注单 token 生成延迟和用户能够实际获得的 tokens/s。



因此,NVIDIA 正在开始把不同类型的 Agent 计算分配给不同处理器:Vera CPU 负责模型之外的任务编排、代码执行和数据处理;Rubin GPU 承担大规模模型计算、长上下文以及高吞吐推理;Groq 3 LPX 则进一步针对高交互、低延迟 token 生成进行优化。

第三方机构 Artificial Analysis 在 Gemma 4 31B 模型、100K 上下文测试中,测得 Groq 3 LPX 达到 3431 output tokens/s;NVIDIA 自己的 SPEED-Bench 测试中,其编码任务中位生成速度达到 4767 output tokens/s。

更重要的是,Groq 3 LPX 可以直接与 Vera Rubin NVL72 组合运行。一种方案是让 Rubin 负责 Prefill,再将 Decode 交给 Groq 3 LPX;也可以进一步拆分 Attention 和 FFN 计算,或者让 LPX 承担 speculative decoding 中的 draft model。



这意味着,Agent 背后的计算系统可能不会再由一种通用处理器承担全部工作,而会越来越接近一座异构计算工厂:不同芯片处理最适合自己的计算阶段,再由高速互联、缓存和软件系统把它们组合成一条完整的 token 生产线。



事实上,NVIDIA 目前的 Vera Rubin 平台已经扩展为一个包含多类芯片的系统,包括 Vera CPU、Rubin GPU、Groq 3 LPU、NVLink 6 Switch、BlueField-4 DPU、ConnectX-9 SuperNIC 以及 Spectrum-6 Ethernet。

GPU 仍然位于整个系统的核心位置,但它已经不再独立承担 AI 基础设施的全部竞争任务。

SpaceX 加入:从 AI 工厂走向轨道计算

Vera Rubin 的另一项重要应用来自 SpaceXAI。

NVIDIA 宣布,SpaceXAI 将部署 Vera CPU,用于加速下一代 Agentic AI 应用,包括任务编排、代码执行和数据处理。同时,SpaceXAI 计划基于 NVIDIA Vera Rubin 架构扩展支撑 Grok 的 AI 基础设施,并计划随着计算基础设施继续扩张,向吉瓦级计算容量发展。

据马斯克透露,SpaceX 与 NVIDIA 已经设计了一套针对太空环境优化的 Vera Rubin NVL72 系统,计划于明年第四季度发射进入轨道,并在 2028 年实现更大规模部署。



不过,轨道计算并不是简单把地面服务器搬到太空。太空环境对于计算系统提出了完全不同的要求:有限能源、更复杂散热条件、更高可靠性要求,以及长期无人维护能力。

因此,SpaceX 和 NVIDIA 正在探索如何将 Vera Rubin 架构适配到轨道环境,同时保持统一的软件生态。

AI 基础设施竞争进入 Agent 时代

过去,AI 产业竞争围绕模型展开。谁拥有更强的大模型,谁就拥有优势。但 Agent 时代改变了竞争规则。

当 AI 开始执行长链路任务,计算系统需要同时解决性能、成本、能源效率和任务调度问题。

Vera Rubin 代表的是 NVIDIA 对下一阶段 AI 基础设施的判断:未来的 AI 工厂,不只是训练模型的地方,也将成为大量 Agent 持续运行的计算平台。

而 SpaceX 探索的轨道计算,则进一步拓展了这种架构的边界。从地面 AI 工厂,到未来可能出现的轨道计算节点,AI 基础设施进入到了一个新的阶段。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
广东省委书记黄坤明考察调研小鹏人形机器人创新成果

广东省委书记黄坤明考察调研小鹏人形机器人创新成果

呼呼历史论
2026-09-12 19:45:45
浙江一女子做代丢垃圾副业,一次3元包月99元,当事人:开工仅3天就有20多个客户,年轻人愿意花点小钱节省时间

浙江一女子做代丢垃圾副业,一次3元包月99元,当事人:开工仅3天就有20多个客户,年轻人愿意花点小钱节省时间

台州交通广播
2026-09-12 12:36:32
成人片单!5部无下限生猛R级片,荷尔蒙溢出屏幕,不建议一人看

成人片单!5部无下限生猛R级片,荷尔蒙溢出屏幕,不建议一人看

得心电影
2026-09-06 16:15:13
“学生”称因发表“农民上大学很荒谬言论将被开除”,中国农大回应:经核查,非本校人员

“学生”称因发表“农民上大学很荒谬言论将被开除”,中国农大回应:经核查,非本校人员

新浪财经
2026-09-10 14:34:51
在塞尔维亚待了12天,只要对方看出你是中国人,那态度真就变了

在塞尔维亚待了12天,只要对方看出你是中国人,那态度真就变了

石辰搞笑日常
2026-09-13 00:35:28
师长当场被斩首!胡塞全线击溃敌军,横扫战场,特朗普暗松一口气

师长当场被斩首!胡塞全线击溃敌军,横扫战场,特朗普暗松一口气

咸鱼金脑袋
2026-09-12 09:49:56
江苏省退休人员9月重要提醒!养老金两件关键事,认准官方信息

江苏省退休人员9月重要提醒!养老金两件关键事,认准官方信息

呼呼历史论
2026-09-12 21:05:11
沈阳换帅,巾帼不让须眉,马珊珊报到!

沈阳换帅,巾帼不让须眉,马珊珊报到!

记者王立君
2026-09-12 22:11:53
“不如炒盘鸡蛋!”山东家长晒4个孩子晚餐,蛋白质趋近于0!

“不如炒盘鸡蛋!”山东家长晒4个孩子晚餐,蛋白质趋近于0!

林林先生
2026-08-27 19:14:35
75岁王石赛场上狂奔92分钟,田朴珺举着手机在场边等他

75岁王石赛场上狂奔92分钟,田朴珺举着手机在场边等他

南万说娱26
2026-09-12 09:19:06
9月10日晚上,根据中方公布的消息,应印度总理莫迪邀请,中方将于9月12日至13日赴印度新德里出席金砖峰会。

9月10日晚上,根据中方公布的消息,应印度总理莫迪邀请,中方将于9月12日至13日赴印度新德里出席金砖峰会。

回京历史梦
2026-09-11 17:35:27
银行重大变革!或将彻底改写中国存款格局,未来3年利息要变天?

银行重大变革!或将彻底改写中国存款格局,未来3年利息要变天?

小娱乐悠悠
2026-09-12 09:54:59
五星:申花外援马纳法与爱人在中国完婚,特谢拉和拉唐当伴郎

五星:申花外援马纳法与爱人在中国完婚,特谢拉和拉唐当伴郎

懂球帝
2026-09-12 15:55:12
中国小花第2人!孙心然决胜盘送蛋强势复仇,首夺大满贯冠军

中国小花第2人!孙心然决胜盘送蛋强势复仇,首夺大满贯冠军

全景体育V
2026-09-13 06:14:35
要真打起来,中国导弹能不能干掉美国航母?答案是,基本没戏。就算鹰击-21这种猛家伙真打中了航母,想一发就把它直接送进海底,那做不到

要真打起来,中国导弹能不能干掉美国航母?答案是,基本没戏。就算鹰击-21这种猛家伙真打中了航母,想一发就把它直接送进海底,那做不到

扶苏聊历史
2026-09-10 17:57:49
终结一年进球荒,圣地亚哥91分钟点球破门收获波尔图处子球

终结一年进球荒,圣地亚哥91分钟点球破门收获波尔图处子球

懂球帝
2026-09-13 07:10:09
最贵299美元,iPhone 18 Pro手机壳提前开卖

最贵299美元,iPhone 18 Pro手机壳提前开卖

我是一个粉刷匠2
2026-09-12 03:52:39
随着中国男篮105-59狂胜巴林,亚运最新形势:8强出3席,日韩争头名

随着中国男篮105-59狂胜巴林,亚运最新形势:8强出3席,日韩争头名

球场没跑道
2026-09-12 16:55:43
突发!马斯克出事了!

突发!马斯克出事了!

财经要参
2026-09-12 15:38:35
自2016年以来,皇马首次在伯纳乌连续4场西甲打入至少4球

自2016年以来,皇马首次在伯纳乌连续4场西甲打入至少4球

懂球帝
2026-09-13 05:39:03
2026-09-13 07:23:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13975文章数 142733关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

男生去年693分考上北大后放弃 今年又拼了一次考714分

头条要闻

男生去年693分考上北大后放弃 今年又拼了一次考714分

体育要闻

乔丹的得分统治力:如何违背篮球规律?

娱乐要闻

钟丽淇疑入ICU?聚会合照早露端倪

财经要闻

继房子茅台后 中产的第3个"神话"破灭了

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

家居
亲子
教育
房产
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

快乐萌娃搞笑日常,太逗了

教育要闻

就差三分,就能及格了

房产要闻

别再等了!广州改善好房,正在进入“卖一套少一套”时代

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版