网易首页 > 网易号 > 正文 申请入驻

OpenAI公布首颗自研推理芯片成绩,下一代已进入制造阶段

0
分享至



8 月 25 日,OpenAI 公布了首款自研 AI 推理芯片 Jalapeño 的首批性能测试结果。

两个月前,OpenAI 与博通首次正式发布 Jalapeño。当时 OpenAI 只披露了较为概括的早期测试结果,称其第一代加速器每瓦性能将明显高于当时的先进水平。此次更新则首次给出了 Jalapeño 在多款公开大模型上的具体测试数据,包括 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T。

Jalapeño 是 OpenAI 第一款自研推理芯片,主要针对大语言模型推理设计。OpenAI 负责芯片架构设计,博通参与芯片实现、网络和连接技术,Celestica 则负责板卡、机架和系统集成等工作。OpenAI 此前表示,从初始设计到完成流片,Jalapeño 大约用了 9 个月。

为了解 Jalapeño 的实际性能,OpenAI 使用 SemiAnalysis 的公开基准测试工具 InferenceX 对其进行了测试,并将其与英伟达 GB200、GB300 系统进行比较,测试范围涵盖了从高吞吐量服务到高交互性、低延迟的应用场景。

SemiAnalysis 甚至在一份文档中写道:“在我们测试过的所有 Nvidia、AMD 和 Google 芯片上,OpenAI 在多个顶级开源模型上的表现都优于它们。”

从整体结果看,Jalapeño 最突出的特点是,在较低功耗下,同时实现了更高的推理吞吐量和更低的生成延迟。

OpenAI 公布的数据显示,在此次测试的三款模型上,Jalapeño 的峰值每瓦吞吐量是对比系统的 1.5 至 1.9 倍。与此同时,在强调低延迟和单用户生成速度的测试中,其表现也高于对比系统。

以 OpenAI 自己发布的 GPT-OSS 120B 为例,Jalapeño 的对比对象是英伟达 GB200。在峰值吞吐量下,Jalapeño 每千瓦最高可以处理约 8.54 万个 token/s,GB200 约为 4.5 万个,前者约为后者的 1.9 倍。


(来源:OpenAI)

在生成速度方面,Jalapeño 连续两个 token 之间的最短时间间隔为 0.69 毫秒,相当于单个用户每秒最高可以生成约 1,459 个 token;GB200 的这一数字约为 535 个 token/s。

在参数规模更大的 DeepSeek R1 上,OpenAI 将 Jalapeño 与 GB300 进行了比较。Jalapeño 的峰值每千瓦吞吐量约为 1.96 万 token/s,GB300 约为 1.18 万,前者约高 1.7 倍。

在低延迟状态下,Jalapeño 的单用户生成速度最高约为 700 token/s,GB300 约为 169 token/s,前者约为后者的 4.1 倍。


(来源:OpenAI)

测试中最大的模型是拥有约 1 万亿参数的 Kimi K2.5。在这款模型上,Jalapeño 每千瓦峰值吞吐量约为 1.82 万 token/s,GB300 约为 1.19 万,前者约高 1.5 倍。

在单用户生成速度上,Jalapeño 最高约为 694 token/s,GB300 约为 182 token/s,差距约为 3.8 倍。最低端到端延迟分别为 1.56 秒和 5.31 秒。

除了比较各自的最高性能,OpenAI 还给出了另一组测试结果:如果让 Jalapeño 和对比系统保持相同的单用户生成速度,再比较它们可以同时处理多少推理任务,Jalapeño 的吞吐量差距会进一步扩大。

以 DeepSeek R1 为例,当两套系统都维持在约 169 token/s 的单用户生成速度时,Jalapeño 每千瓦可以处理约 1.23 万 token/s,而 GB300 约为 118。按照这一口径计算,Jalapeño 的吞吐量达到 GB300 的约 104 倍。

在 GPT-OSS 120B 和 Kimi K2.5 上,类似测试得到的差距分别约为 53.7 倍和 56.1 倍。


(来源:OpenAI)

不过,这组数字并不意味着 Jalapeño 的芯片计算性能本身比 GB300 高 104 倍。它反映的是,在保持相同单用户生成速度的情况下,Jalapeño 能够同时承载更多推理任务。

功耗是此次测试中另一项重要指标。

Jalapeño 的额定功耗为 700W,此次作为对比的英伟达 GB200 和 GB300 分别按照 1,200W 和 1,400W 计算。OpenAI 表示,在实际测试中,Jalapeño 的持续功耗没有超过 550W,但计算每瓦性能时仍统一按照 700W 的额定功耗进行比较。

SemiAnalysis 此次进入 OpenAI 实验室查看了 Jalapeño,并现场验证了 InferenceX 的运行。目前测试使用的仍是 A0 版工程芯片,下一版 B0 已进入制造阶段。SemiAnalysis 披露,B0 采用台积电 N3P工艺,MXFP4 理论算力达到 13.4 PFLOPS,额定功耗仍为 700W。

内存方面,Jalapeño 将搭载 HBM4,单封装内存带宽约为 15.4TB/s,并配有独立 I/O 芯片,负责机架内和跨机架通信。

在推理架构上,Jalapeño 由同一套加速器完成 prefill 和 decode 两个阶段,也就是既负责处理用户输入,也负责后续逐个生成 token,而不是分别交给不同类型的芯片。

软件适配方面,此次测试的三款模型并非全部来自 OpenAI。除 GPT-OSS 120B 外,DeepSeek R1 和 Kimi K2.5 均来自外部团队。OpenAI 表示,团队借助 Codex 和 GPT-Astra,在大约两个月内完成了这些模型的移植和优化。

AI 也参与了芯片软件优化。OpenAI 披露,在 GPT-OSS 的部分 attention 和 MoE 模块中,由 AI 生成的 kernel 比此前人工专家编写的版本快 1.5 至 1.8 倍。不过这一提升只针对部分模块,并不代表整个模型获得相同比例的性能提升。

目前,Jalapeño 仍处于正式部署前的生产认证和软件完善阶段。SemiAnalysis 也指出,此次公开的主要性能数据由 OpenAI 提供,虽然其在现场验证了 InferenceX 的运行,但并未独立完成全部测试。

此外,目前公开结果主要来自约 8k 输入、1k 输出的单轮推理场景。对于更长上下文、多轮交互等智能体工作负载,OpenAI 尚未公布测试结果。

按照计划,第一代 Jalapeño 将在 2026 年底前开始部署到 OpenAI 自有计算基础设施中。第二代产品已经进入深入开发阶段,第三代也已开始规划。与此同时,OpenAI 表示,未来仍将继续使用英伟达及其他合作伙伴提供的芯片。

1.https://substack.com/home/post/p-212647373

2.https://openai.com/index/jalapeno-first-results/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
央行行长潘功胜,最新发声

央行行长潘功胜,最新发声

证券时报
2026-09-02 19:26:05
中一签或赚超28万!国产GPU四小龙之一,今日申购

中一签或赚超28万!国产GPU四小龙之一,今日申购

21世纪经济报道
2026-09-02 07:50:40
全红婵近照变化太大了,熬过了最难的发育关,小姑娘彻底长开了,模样跟以前判若两人

全红婵近照变化太大了,熬过了最难的发育关,小姑娘彻底长开了,模样跟以前判若两人

In风尚
2026-08-22 06:04:58
马斯克:穷人之所以穷,只有一个原因——没看透人与人之间利益交换的本质

马斯克:穷人之所以穷,只有一个原因——没看透人与人之间利益交换的本质

杏花烟雨江南的碧园
2026-08-20 11:15:03
莱万:皇马有新援和穆帅加入后感觉更强了,但我始终支持巴萨

莱万:皇马有新援和穆帅加入后感觉更强了,但我始终支持巴萨

懂球帝
2026-09-02 18:28:09
吴石案终极潜伏者隐姓 42 年,晚年返大陆热泪盈眶

吴石案终极潜伏者隐姓 42 年,晚年返大陆热泪盈眶

唠叨说历史
2026-01-07 12:42:21
大开眼界!许家印当年奢靡生活曝光

大开眼界!许家印当年奢靡生活曝光

麦杰逊
2026-08-23 15:09:25
全能天才!阿森纳压哨截胡曼联!完美复刻厄德高 + 斯凯利

全能天才!阿森纳压哨截胡曼联!完美复刻厄德高 + 斯凯利

澜归序
2026-09-02 08:17:16
胡军李乃文“大闹”内娱综艺,今年最好笑的节目

胡军李乃文“大闹”内娱综艺,今年最好笑的节目

娱乐圈十三太保
2026-09-02 16:38:02
深圳将新增一家山姆会员店!

深圳将新增一家山姆会员店!

深圳晚报
2026-09-02 16:31:56
我国每年近千万人做肠镜!医生直言:做一次肠镜,或管十年无碍

我国每年近千万人做肠镜!医生直言:做一次肠镜,或管十年无碍

芹姐说生活
2026-08-26 23:55:43
有本事多重要?20万天价富豪饭局,张雪一分没花,一句话道破玄机

有本事多重要?20万天价富豪饭局,张雪一分没花,一句话道破玄机

秋姐居
2026-09-02 10:04:25
“半月工资仅55元,被踢出845个工作群”,官方回应:用人单位已全额支付判决确定的费用,针对该员工新提出的社保相关诉求,将会同有关部门进行核处

“半月工资仅55元,被踢出845个工作群”,官方回应:用人单位已全额支付判决确定的费用,针对该员工新提出的社保相关诉求,将会同有关部门进行核处

每日经济新闻
2026-09-01 19:34:59
燃气公司上门安检,根本不是查漏气!真正目的其实是这三件事

燃气公司上门安检,根本不是查漏气!真正目的其实是这三件事

阿离家居
2026-08-31 03:09:49
半年亏21亿,智谱开网店卖token

半年亏21亿,智谱开网店卖token

观察者网
2026-09-02 15:30:40
什么情况?范子铭首发登场30分钟10中1 手感不佳连续秀中投惹争议

什么情况?范子铭首发登场30分钟10中1 手感不佳连续秀中投惹争议

狼叔评论
2026-09-02 20:12:03
媒体人:国家不欠刘翔的!他自己非要留在体制内 享受最顶级待遇

媒体人:国家不欠刘翔的!他自己非要留在体制内 享受最顶级待遇

念洲
2026-08-30 09:09:35
iPhone Ultra 要发布了!直接提前看

iPhone Ultra 要发布了!直接提前看

花果科技
2026-09-02 13:54:13
一个巴西球员,在中国赚了9.4亿:钱从哪来的,最后谁买单

一个巴西球员,在中国赚了9.4亿:钱从哪来的,最后谁买单

生活新鲜市
2026-08-23 05:24:19
76岁大爷每天暴走2万步,退休金8000,最后死在睡梦中

76岁大爷每天暴走2万步,退休金8000,最后死在睡梦中

小鹿姐姐情感说
2026-09-01 11:37:45
2026-09-02 20:56:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17180文章数 515198关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

10万级的满配B级车 试驾2027款比亚迪海豹06

态度原创

艺术
健康
数码
家居
亲子

艺术要闻

明代隐藏的“草书奇才”!水平不输张旭、怀素,当今知道他的人不足1%

越吃越爆痘?医生讲清7大真相

数码要闻

宏碁推出SFF RTX Spark迷你主机,最高128GB内存

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

宝蓝和弟弟妹妹手上涂满颜料,用手掌画画,有趣又漂亮~

无障碍浏览 进入关怀版