网易首页 > 网易号 > 正文 申请入驻

3431tokens/秒!英伟达Groq 3 LPX全面投产,实测数据首次披露

0
分享至


芯东西(公众号:aichip001)
编译 崔嫄伟
编辑 陈骏达

芯东西8月25日消息,昨日,英伟达在官网上宣布,面向Vera Rubin平台的Groq 3 LPX交互式推理机架已进入全面投入生产阶段。

该产品是英伟达收购Groq相关技术后首款商业化落地的机架级专用推理系统,作为Vera Rubin平台的扩展组件,专门面向AI Agent场景,解决长上下文下实时交互推理的行业痛点,Nebius是首家采用NVIDIA Groq 3 LPX的AI云服务提供商。

同日,英伟达开发者博客发布深度技术长文,详解Groq 3 LPX与Vera Rubin NVL72的软硬件协同架构,并首次披露独立第三方机构Artificial Analysis的基准测试结果。

Artificial Analysis是行业公认的中立 AI 性能评测机构,本次测试选用谷歌 2026年4月发布的Gemma 4‑31B稠密模型,该模型已经完成针对英伟达硬件的官方适配优化。在10万tokens长上下文测试环境下,Groq 3 LPX实现 3431tokens/s 的输出速度,性能达到当前公开同类方案的近4倍,同时保证模型输出精度不受损失。

一、长上下文+高交互,成为AI算力新瓶颈

随着AI Agent应用普及,多轮对话、代码生成等场景的上下文长度持续膨胀,数百轮对话后,上下文可达到数十万tokens量级。模型每一轮生成内容,都需要重新处理全部历史信息。

行业普遍痛点在于:上下文越长,推理速度越慢;而实时交互又要求单用户低延迟响应,两者难以兼顾。


▲在多轮会话中,每轮对话中蕴含的上下文信息稳步增加

传统方案通常采用张量并行(将模型拆分到多颗芯片并行计算)提升速度,但该技术在高交互的小批量场景下会出现明显短板:芯片间通信的固定启动开销占比会急剧升高,最终抵消并行计算带来的速度收益。简单来说,用户请求越零散、数据量越小,“建立连接、调度链路” 的等待时间就越容易成为性能瓶颈。

二、两大核心技术路径,破解长上下文高速交互难题

Groq 3 LPX是英伟达Vera Rubin平台的专用推理扩展系统,主打小批量、低延迟、长上下文场景,核心通过两项技术设计解决通信开销问题。

为了规避运行时通信调度带来的性能损耗,Groq 3 LPX采用确定性执行架构。在任务开始运行前,编译器就已经掌握所有计算单元、高速内存、芯片间直连链路的全部信息,提前生成精确到时钟周期的传输时间表。

与传统 “数据到达后再申请链路、争抢带宽” 的动态调度不同,这套方案提前规划好每一份数据的传输时机与路径,完全省去了实时仲裁、链路冲突等待的时间,将芯片间通信的固定启动开销压到极低水平,让张量并行在小批量场景下也能发挥出加速效果。

除此之外,Groq 3 LPX还实现了细粒度的计算‑通信重叠,以此减少算力空转。传统推理模式需要等一整块矩阵运算全部完成,再统一传输结果,会产生明显的 “通信尾部” 等待时间。

Groq 3 LPX将计算拆分为320字节的极小粒度,每计算完一小块结果就立刻通过芯片间链路发送,实现计算与传输的高度重叠。这种 “边算边传” 的模式大幅压缩了总耗时,尤其适合长上下文推理中计算量最大的注意力算子。

三、实测验证:速度提升超30倍,性能几乎不受上下文长度影响

第三方机构Artificial Analysis选用谷歌开源的Gemma 4-31B稠密模型完成标准化测试。本次测试专门针对长上下文AI推理的输出速度开展评测,分别在1万tokens、10万tokens两种输入上下文条件下,验证硬件在不同上下文长度下的生成性能;同时额外开展代码生成专项测试,考察硬件处理智能体代码任务的实际表现。该模型于2026年4月发布,官方已针对英伟达算力平台做了性能适配,是行业通用的推理性能基准测试模型,核心结果如下:

10万tokens长上下文:中位数输出速度3431tokens/s,是当前公开最快端点(870tokens/s)的3.9倍;

1万tokens短上下文:中位数输出速度3382tokens/s,性能几乎不受上下文长度影响;

在SPEED-Bench编程基准中,Groq 3 LPX搭载同款Gemma 4‑31B模型,测得中位数速度达4767tokens/s,20%的任务速度超过5520tokens/s。


▲ Artificial Analysis测试结果

从体感来看,生成5000个token的内容,该方案仅需约1.5秒;而当前主流智能体工具速度约60tokens/s,完成相同内容需要近80秒,性能提升超过30倍。测试同时确认,该配置下模型输出无精度损失、无效果下降。

四、与Vera Rubin NVL72协同,支持三种部署模式

Groq 3 LPX并非独立运行的替代产品,而是Vera Rubin平台的能力扩展,与Vera Rubin NVL72机架形成互补:NVL72擅长大规模输入处理、长上下文缓存存储;Groq 3 LPX擅长高速解码生成。二者通过架构级协同,支持三种主流部署模式:

预填充-解码分离(标准模式):NVL72负责处理输入上下文、生成KV缓存,交给LPX完成高速输出生成,实现 “读资料” 和 “写回答” 的硬件分工;

注意力-前馈网络分离:NVL72运行注意力层并维护缓存,LPX运行前馈网络层,机架间仅传输少量中间结果;

投机解码协同:LPX运行小型草稿模型快速生成候选token,NVL72上的大模型负责校验纠错,进一步提升整体生成速度。

官方表示,这套协同方案可支撑2万亿参数级别的多智能体系统,兼顾长上下文与高交互需求。

结语:架构协同新范式:AI智能体算力走向专用化分工

从通用GPU大一统,走向 “通用算力 + 专用推理” 的架构协同,正在成为AI算力的新趋势。除英伟达Groq 3 LPX方案外,行业内也出现了不少异构分离推理的探索:例如部分厂商将预填充与解码阶段拆分,由不同硬件分别承担上下文处理、token生成两类任务;Cerebras、AMD也推出了机架级异构推理方案,尝试把高吞吐的通用算力与低延迟专用推理硬件做组合调度。

Groq 3 LPX的量产落地,补上了Vera Rubin平台在高交互长上下文场景的能力短板,也为AI智能体、代码助手等强交互应用的规模化落地,提供了关键的算力支撑。不过异构架构也对软硬件调度、芯片间通信、KV缓存跨硬件流转提出更高的工程要求,后续还需要在生态适配、成本控制上持续打磨。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
从天上人间到白马会所,多地老牌灰色会所相继覆灭!浙江重拳整治商K,引热议

从天上人间到白马会所,多地老牌灰色会所相继覆灭!浙江重拳整治商K,引热议

火山詩话
2026-09-15 07:49:30
54岁藤原纪香,从未活在美颜滤镜里

54岁藤原纪香,从未活在美颜滤镜里

草莓解说体育
2026-09-15 06:46:01
砸31亿!赛力斯把Logo盖成大楼,最新实景图曝光!

砸31亿!赛力斯把Logo盖成大楼,最新实景图曝光!

GA环球建筑
2026-09-14 21:59:53
震惊!杭州买房裸泳大有人在!媒体调查报告:好多300-500万的刚需,首付15%的占大多数

震惊!杭州买房裸泳大有人在!媒体调查报告:好多300-500万的刚需,首付15%的占大多数

火山詩话
2026-09-14 20:04:16
上海公安依法处警后遭起诉 男子要求公安赔偿14亿人每人1万美元,并由其收取 法院:驳回

上海公安依法处警后遭起诉 男子要求公安赔偿14亿人每人1万美元,并由其收取 法院:驳回

信网
2026-09-15 08:05:42
离谱!2名青少年“捐赠日本侵华证据”,竟然出现德军三号突击炮!

离谱!2名青少年“捐赠日本侵华证据”,竟然出现德军三号突击炮!

军武次位面
2026-09-14 18:32:17
演员中村友理去世,年仅44岁,曾参演是枝裕和导演多部作品

演员中村友理去世,年仅44岁,曾参演是枝裕和导演多部作品

韩小娱
2026-09-15 06:57:39
演唱会求婚观众高喊“坐下”引热议,自称求婚当事人发声:已报警,要求下架视频

演唱会求婚观众高喊“坐下”引热议,自称求婚当事人发声:已报警,要求下架视频

韩小娱
2026-09-15 06:46:33
河南登封市少林武术协会发布讣告:中国当代十大武术名师梁以全辞世,享年97岁

河南登封市少林武术协会发布讣告:中国当代十大武术名师梁以全辞世,享年97岁

环球网资讯
2026-09-15 13:27:05
我替局长承担处分在基层五年,他调省厅没音讯,今天厅办来电:领导要你立刻来一趟

我替局长承担处分在基层五年,他调省厅没音讯,今天厅办来电:领导要你立刻来一趟

白浅娱乐聊
2026-09-15 08:26:13
江苏省委书记、江西省委书记、山东省委书记,带头捐款

江苏省委书记、江西省委书记、山东省委书记,带头捐款

阜阳发布
2026-09-05 18:02:35
卖发动机的Tina,让外国人疯狂

卖发动机的Tina,让外国人疯狂

南风窗
2026-09-14 14:09:29
英国前首相鲍里斯差点被炸死!俄450架无人机夜袭乌克兰,击中波乌边境列车

英国前首相鲍里斯差点被炸死!俄450架无人机夜袭乌克兰,击中波乌边境列车

西游日记
2026-09-14 20:37:41
杭州13岁初中生身高1米9,拥有全网50万粉丝,有人称他是“天才少年”“未来马斯克”,父母却极其冷静

杭州13岁初中生身高1米9,拥有全网50万粉丝,有人称他是“天才少年”“未来马斯克”,父母却极其冷静

都市快报橙柿互动
2026-09-15 10:43:07
扎哈罗娃“惭愧”承认:之前并不知道“百闻不如一见”是从中国传来的

扎哈罗娃“惭愧”承认:之前并不知道“百闻不如一见”是从中国传来的

环球网资讯
2026-09-15 06:58:37
黄仁勋论坛现场接特朗普电话:不会让AI减速发生,“AI末日论”没有科学依据

黄仁勋论坛现场接特朗普电话:不会让AI减速发生,“AI末日论”没有科学依据

澎湃新闻
2026-09-15 09:46:26
中国就没把印度当回事?峰会一结束,中国代表团一刻没停离开印度

中国就没把印度当回事?峰会一结束,中国代表团一刻没停离开印度

闻香阁
2026-09-15 02:01:01
人民日报推荐消除内脏脂肪锻炼方式:简单到想不到,但试后真有效

人民日报推荐消除内脏脂肪锻炼方式:简单到想不到,但试后真有效

观星赏月
2026-09-15 07:41:35
东北的现在,就是中国的未来(深度好文)

东北的现在,就是中国的未来(深度好文)

犀利辣椒
2026-09-15 06:23:05
范志毅前妻李倩现状:英国再婚生俩混血儿子,女儿跨国探望

范志毅前妻李倩现状:英国再婚生俩混血儿子,女儿跨国探望

南万说娱26
2026-09-15 08:58:45
2026-09-15 14:15:00
芯东西 incentive-icons
芯东西
智东西AI媒体矩阵品牌。芯东西,芯片产业新媒体。我们是一群追芯人,专注报道AI芯片和半导体产业创新。
2595文章数 8160关注度
往期回顾 全部

科技要闻

芯片产业链蒸发超5000亿美元,特朗普大怒

头条要闻

娃哈哈虎林工厂房产被查封:100多人被欠缴200万公积金

头条要闻

娃哈哈虎林工厂房产被查封:100多人被欠缴200万公积金

体育要闻

英格兰业余门将,拒绝去非洲当国王

娱乐要闻

她是敬一丹女儿,把公益当事业

财经要闻

未来五年,电子信息制造业发展规划出炉

汽车要闻

纯电续航960km/迪迪虾上车 腾势N8L纯电售29.98万元起

态度原创

家居
本地
旅游
游戏
数码

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

不止胖东来!许昌藏着半部三国史

旅游要闻

临沂的秋夜,也太美了吧!

毁灭战士黑暗时代国区售价永降!大跳水近100块

数码要闻

HORI为Nintendo Switch 2带来复古格斗控制器,采用模块化摇杆

无障碍浏览 进入关怀版