网易首页 > 网易号 > 正文 申请入驻

3431tokens/秒!英伟达Groq 3 LPX全面投产,实测数据首次披露

0
分享至


芯东西(公众号:aichip001)
编译 崔嫄伟
编辑 陈骏达

芯东西8月25日消息,昨日,英伟达在官网上宣布,面向Vera Rubin平台的Groq 3 LPX交互式推理机架已进入全面投入生产阶段。

该产品是英伟达收购Groq相关技术后首款商业化落地的机架级专用推理系统,作为Vera Rubin平台的扩展组件,专门面向AI Agent场景,解决长上下文下实时交互推理的行业痛点,Nebius是首家采用NVIDIA Groq 3 LPX的AI云服务提供商。

同日,英伟达开发者博客发布深度技术长文,详解Groq 3 LPX与Vera Rubin NVL72的软硬件协同架构,并首次披露独立第三方机构Artificial Analysis的基准测试结果。

Artificial Analysis是行业公认的中立 AI 性能评测机构,本次测试选用谷歌 2026年4月发布的Gemma 4‑31B稠密模型,该模型已经完成针对英伟达硬件的官方适配优化。在10万tokens长上下文测试环境下,Groq 3 LPX实现 3431tokens/s 的输出速度,性能达到当前公开同类方案的近4倍,同时保证模型输出精度不受损失。

一、长上下文+高交互,成为AI算力新瓶颈

随着AI Agent应用普及,多轮对话、代码生成等场景的上下文长度持续膨胀,数百轮对话后,上下文可达到数十万tokens量级。模型每一轮生成内容,都需要重新处理全部历史信息。

行业普遍痛点在于:上下文越长,推理速度越慢;而实时交互又要求单用户低延迟响应,两者难以兼顾。


▲在多轮会话中,每轮对话中蕴含的上下文信息稳步增加

传统方案通常采用张量并行(将模型拆分到多颗芯片并行计算)提升速度,但该技术在高交互的小批量场景下会出现明显短板:芯片间通信的固定启动开销占比会急剧升高,最终抵消并行计算带来的速度收益。简单来说,用户请求越零散、数据量越小,“建立连接、调度链路” 的等待时间就越容易成为性能瓶颈。

二、两大核心技术路径,破解长上下文高速交互难题

Groq 3 LPX是英伟达Vera Rubin平台的专用推理扩展系统,主打小批量、低延迟、长上下文场景,核心通过两项技术设计解决通信开销问题。

为了规避运行时通信调度带来的性能损耗,Groq 3 LPX采用确定性执行架构。在任务开始运行前,编译器就已经掌握所有计算单元、高速内存、芯片间直连链路的全部信息,提前生成精确到时钟周期的传输时间表。

与传统 “数据到达后再申请链路、争抢带宽” 的动态调度不同,这套方案提前规划好每一份数据的传输时机与路径,完全省去了实时仲裁、链路冲突等待的时间,将芯片间通信的固定启动开销压到极低水平,让张量并行在小批量场景下也能发挥出加速效果。

除此之外,Groq 3 LPX还实现了细粒度的计算‑通信重叠,以此减少算力空转。传统推理模式需要等一整块矩阵运算全部完成,再统一传输结果,会产生明显的 “通信尾部” 等待时间。

Groq 3 LPX将计算拆分为320字节的极小粒度,每计算完一小块结果就立刻通过芯片间链路发送,实现计算与传输的高度重叠。这种 “边算边传” 的模式大幅压缩了总耗时,尤其适合长上下文推理中计算量最大的注意力算子。

三、实测验证:速度提升超30倍,性能几乎不受上下文长度影响

第三方机构Artificial Analysis选用谷歌开源的Gemma 4-31B稠密模型完成标准化测试。本次测试专门针对长上下文AI推理的输出速度开展评测,分别在1万tokens、10万tokens两种输入上下文条件下,验证硬件在不同上下文长度下的生成性能;同时额外开展代码生成专项测试,考察硬件处理智能体代码任务的实际表现。该模型于2026年4月发布,官方已针对英伟达算力平台做了性能适配,是行业通用的推理性能基准测试模型,核心结果如下:

10万tokens长上下文:中位数输出速度3431tokens/s,是当前公开最快端点(870tokens/s)的3.9倍;

1万tokens短上下文:中位数输出速度3382tokens/s,性能几乎不受上下文长度影响;

在SPEED-Bench编程基准中,Groq 3 LPX搭载同款Gemma 4‑31B模型,测得中位数速度达4767tokens/s,20%的任务速度超过5520tokens/s。


▲ Artificial Analysis测试结果

从体感来看,生成5000个token的内容,该方案仅需约1.5秒;而当前主流智能体工具速度约60tokens/s,完成相同内容需要近80秒,性能提升超过30倍。测试同时确认,该配置下模型输出无精度损失、无效果下降。

四、与Vera Rubin NVL72协同,支持三种部署模式

Groq 3 LPX并非独立运行的替代产品,而是Vera Rubin平台的能力扩展,与Vera Rubin NVL72机架形成互补:NVL72擅长大规模输入处理、长上下文缓存存储;Groq 3 LPX擅长高速解码生成。二者通过架构级协同,支持三种主流部署模式:

预填充-解码分离(标准模式):NVL72负责处理输入上下文、生成KV缓存,交给LPX完成高速输出生成,实现 “读资料” 和 “写回答” 的硬件分工;

注意力-前馈网络分离:NVL72运行注意力层并维护缓存,LPX运行前馈网络层,机架间仅传输少量中间结果;

投机解码协同:LPX运行小型草稿模型快速生成候选token,NVL72上的大模型负责校验纠错,进一步提升整体生成速度。

官方表示,这套协同方案可支撑2万亿参数级别的多智能体系统,兼顾长上下文与高交互需求。

结语:架构协同新范式:AI智能体算力走向专用化分工

从通用GPU大一统,走向 “通用算力 + 专用推理” 的架构协同,正在成为AI算力的新趋势。除英伟达Groq 3 LPX方案外,行业内也出现了不少异构分离推理的探索:例如部分厂商将预填充与解码阶段拆分,由不同硬件分别承担上下文处理、token生成两类任务;Cerebras、AMD也推出了机架级异构推理方案,尝试把高吞吐的通用算力与低延迟专用推理硬件做组合调度。

Groq 3 LPX的量产落地,补上了Vera Rubin平台在高交互长上下文场景的能力短板,也为AI智能体、代码助手等强交互应用的规模化落地,提供了关键的算力支撑。不过异构架构也对软硬件调度、芯片间通信、KV缓存跨硬件流转提出更高的工程要求,后续还需要在生态适配、成本控制上持续打磨。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
忍无可忍,无需再忍!一场恶仗已逼近中国,东大不必再手下留情了

忍无可忍,无需再忍!一场恶仗已逼近中国,东大不必再手下留情了

乌克兰小静
2026-09-15 08:09:52
上海体育局局长职位易人 让刘翔买断走人之人下课钟晓敏任新局长

上海体育局局长职位易人 让刘翔买断走人之人下课钟晓敏任新局长

劲爆体坛
2026-09-14 23:07:05
德国20座城市爆发示威,15万人上街反对选择党,要求立即取缔

德国20座城市爆发示威,15万人上街反对选择党,要求立即取缔

铁锤侃侃而谈
2026-09-14 01:01:31
局长杨拥军、原副局长赵文华同一日被查

局长杨拥军、原副局长赵文华同一日被查

北疆新闻
2026-09-15 09:43:44
大阪街头埃尔法贴着:车内有中国人……

大阪街头埃尔法贴着:车内有中国人……

日本物语
2026-09-12 20:36:48
齐达内致命危机!法国队内讧大爆发!两大世界级巨星彻底撕破脸

齐达内致命危机!法国队内讧大爆发!两大世界级巨星彻底撕破脸

奶盖熊本熊
2026-09-15 07:28:14
哈里梅根的儿女上学仅两天就转走,“安全顾虑”,红发王子的小心思快得逞了

哈里梅根的儿女上学仅两天就转走,“安全顾虑”,红发王子的小心思快得逞了

译言
2026-09-15 07:01:00
2026.9.13崇明隧道大火,关键时刻千万别贪财,快撤!

2026.9.13崇明隧道大火,关键时刻千万别贪财,快撤!

音乐时光的娱乐
2026-09-15 05:40:19
美财政部宣布将俄罗斯外贸银行列为制裁目标,理由是该行“涉嫌协助规避针对伊朗的制裁”

美财政部宣布将俄罗斯外贸银行列为制裁目标,理由是该行“涉嫌协助规避针对伊朗的制裁”

鲁中晨报
2026-09-15 07:23:08
72分碾压夺冠!印度女队创8冠神迹,却当众拒绝领取亚洲杯奖杯

72分碾压夺冠!印度女队创8冠神迹,却当众拒绝领取亚洲杯奖杯

开着车去流浪
2026-09-15 06:58:29
乌兹别克空军曝内幕:中国运-9只是安-12改款,根本满足不了需求

乌兹别克空军曝内幕:中国运-9只是安-12改款,根本满足不了需求

近史谈
2026-09-14 17:24:15
刘翔官宣买断仅1天,恶心的一幕出现了,耐克没给刘翔留一丝体面

刘翔官宣买断仅1天,恶心的一幕出现了,耐克没给刘翔留一丝体面

风雨与阳光
2026-09-14 23:52:06
误判哈兰德进球有效!曼市德比VAR裁判被停哨1周 曼联可要求重赛

误判哈兰德进球有效!曼市德比VAR裁判被停哨1周 曼联可要求重赛

我爱英超
2026-09-15 06:07:21
女子3万买下北京宅基地,20年后拆迁获赔1135万,原房主却说不卖了

女子3万买下北京宅基地,20年后拆迁获赔1135万,原房主却说不卖了

五元讲堂
2025-07-10 09:54:30
加内特:得知我的经纪人拒绝了1.22亿合同后 我立马将其解雇

加内特:得知我的经纪人拒绝了1.22亿合同后 我立马将其解雇

画夕
2026-09-14 05:35:05
彭小苒直播挂脖衫多次走光,粉丝刷屏提醒,工作室凌晨致歉

彭小苒直播挂脖衫多次走光,粉丝刷屏提醒,工作室凌晨致歉

小邵说剧
2026-09-15 08:18:46
“大学生生活费才3000”冲上热搜!一张账单引发热议,网友:月入3000已经属于中产了

“大学生生活费才3000”冲上热搜!一张账单引发热议,网友:月入3000已经属于中产了

火山詩话
2026-09-15 09:10:33
中纪委:严查“兵托”,纵容包庇“兵托”的,从严追责问责!

中纪委:严查“兵托”,纵容包庇“兵托”的,从严追责问责!

职场资深秘书
2026-09-14 18:43:31
特朗普称,可以接受中国车企在美国建厂,《纽约时报》记者试驾中国品牌汽车后立即被征服

特朗普称,可以接受中国车企在美国建厂,《纽约时报》记者试驾中国品牌汽车后立即被征服

极目新闻
2026-09-14 10:17:23
热刺内讧升级!主帅封杀29岁刺头前锋:休想再出场 后者怒了:为啥

热刺内讧升级!主帅封杀29岁刺头前锋:休想再出场 后者怒了:为啥

风过乡
2026-09-15 06:48:01
2026-09-15 12:07:00
芯东西 incentive-icons
芯东西
智东西AI媒体矩阵品牌。芯东西,芯片产业新媒体。我们是一群追芯人,专注报道AI芯片和半导体产业创新。
2595文章数 8160关注度
往期回顾 全部

科技要闻

芯片产业链蒸发超5000亿美元,特朗普大怒

头条要闻

证监会原副主席被判无期 半月内已有9位金融高管落马

头条要闻

证监会原副主席被判无期 半月内已有9位金融高管落马

体育要闻

英格兰业余门将,拒绝去非洲当国王

娱乐要闻

她是敬一丹女儿,把公益当事业

财经要闻

未来五年,电子信息制造业发展规划出炉

汽车要闻

纯电续航960km/迪迪虾上车 腾势N8L纯电售29.98万元起

态度原创

本地
数码
亲子
时尚
公开课

本地新闻

不止胖东来!许昌藏着半部三国史

数码要闻

华为WATCH D3开启预售:更轻更薄,腕上血压管理迈入新时代

亲子要闻

教育行业的大调整来了,入学人口断崖式下滑,教师队伍面临出清

过度防晒,正在掏空女性的骨头

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版