网易首页 > 网易号 > 正文 申请入驻

OpenAI 第一颗芯片杀疯了:吞吐量是 Nvidia 的 104 倍

0
分享至

★ 设为星标 | 只讲人话,带你玩转AIGC。

昨天,OpenAI 公布了 Jalapeño 的首批性能测试结果。

这是 OpenAI 的第一颗定制推理芯片,由 OpenAI 负责核心架构设计,Broadcom 参与芯片实现和网络连接,Celestica 负责电路板、机架和系统整合。

OpenAI 计划在 2026 年年底前开始部署 Jalapeño。Gen 2 已经进入深度开发阶段,Gen 3 也开始成形。

这不是一块用来秀肌肉的样品,而是 OpenAI 准备长期投入的一条芯片产品线。


图:Jalapeño 芯片

跟 Nvidia 正面对打

这次 OpenAI 使用 SemiAnalysis 的公共 InferenceX 基准,测试了 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 三个开放权重模型。

其中,GPT-OSS 对比 Nvidia GB200,DeepSeek 和 Kimi 对比 GB300。测试采用固定的 8K 输入、1K 输出和 STP 模式,衡量完整请求的吞吐量、功耗和延迟。

综合三个模型,Jalapeño 在峰值吞吐状态下,每瓦能够完成的 AI 工作量达到 Nvidia 对比系统的 1.5 至 1.9 倍,端到端延迟优势达到 1.7 至 3.6 倍。


图:Jalapeño delivers more throughput per kilowatt

在强调即时响应的高交互任务中,性能优势进一步扩大到 2.1 至 4.1 倍。

更关键的是,Jalapeño 在整个测试区间都处于帕累托前沿(pareto frontier)。

这个词听着挺学术,理解起来很简单:在相同延迟下,它能提供更高吞吐量;在相同吞吐量下,它又能提供更低延迟。竞争对手很难在不牺牲一项指标的情况下超过它。

既想马儿跑得快,又想马儿吃得少。

以前只能选一个,现在 OpenAI 说它两个都要。

最夸张的数据出现在 DeepSeek R1 上。

GB300 此前能够达到的最佳 Token 间时间为 5.90 毫秒,相当于每个用户每秒获得约 169 个 Token。

把 Jalapeño 限制在相同输出速度下,它每千瓦可以处理 12,258 个混合 Token,而 GB300 只有 118 个。

差距达到 104.3 倍。


图:Mixed-token throughput matched at the existing accelerator’s fastest decoding speed

这个数字是真的,但不能理解成 Jalapeño 的整体性能是 GB300 的一百多倍。

它反映的是一个特定场景:当双方都必须维持 169.41 token/s/user 的高交互速度时,Jalapeño 还能同时服务大量请求,GB300 的总体吞吐量却已经降得很低。

就像两家餐厅都承诺一分钟上一道菜。GB300 为了兑现承诺,只敢接一桌;Jalapeño 保持同样速度,还能同时接很多桌。

如果比较双方各自的峰值单位功耗吞吐量,Jalapeño 在 DeepSeek R1 上的优势约为 1.7 倍。这个数字没有 104.3 倍那么炸裂,却更适合判断两套系统的整体能效差距。


图:DeepSeek R1 “Peak and matched throughput” 对比图

另外两个模型也呈现出相同趋势。

Jalapeño 运行 GPT-OSS 时,峰值单位功耗性能约为 GB200 的 1.9 倍;运行 Kimi K2.5 时,约为 GB300 的 1.5 倍。在匹配 Nvidia 此前最佳交互速度的条件下,两者的单位功耗吞吐量优势分别扩大到 53.7 倍和 56.1 倍。

Jalapeño 的额定功耗为 700 W,测试任务中的持续实测功耗没有超过 550 W。

作为对比,GB200 和 GB300 的公开封装额定功耗分别为 1,200 W 和 1,400 W。

不过,550 W 是 Jalapeño 在特定任务中的实测值,1,200 W 和 1,400 W 是 Nvidia 芯片的额定功耗,两边不是完全相同的测量口径。

OpenAI 正式计算单位功耗成绩时,使用的是各款芯片的公开额定功耗进行统一换算。

即便把宣传滤镜摘掉,Jalapeño 的表现依然很猛。

它把计算、内存、网络、软件和机架放在一起设计,尽量将模型状态和 KV Cache 保留在本地,减少数据在核心与芯片之间来回搬运。

Nvidia 的 GPU 需要兼顾训练、推理、科学计算和图形处理,优势是通用、成熟、生态庞大。Jalapeño 则是一台专门为大模型推理改装的赛车。

赛车不一定能去野外,但在赛道上,它连后排座椅都嫌重。

AI 开始设计自己的芯片

Jalapeño 另一个有意思的地方,是 AI 直接参与了芯片开发。

OpenAI 只用了 9 个月,就把它从初始设计推进到流片。AI 帮助工程师探索实现方案、缩短设计和验证周期,还参与优化了芯片里的算术电路。

OpenAI 不只用 AI 设计芯片,还故意把芯片设计成容易被 AI 编程的样子。

工程师描述数据放在哪里、不同部分怎样通信、任务什么时候同步,Codex 和 GPT-Astra 再继续优化任务的映射、放置和调度。

三个原本不在生产计划里的开放权重模型,只用了 2 个月就被适配到较高性能。在 GPT-OSS 的部分注意力和混合专家模块上,AI 生成的实现比人类专家编写的版本快 1.5 至 1.8 倍。

注意,这只是选定模块,不是整个模型快了 1.8 倍。

OpenAI 想做一条龙

Jalapeño 真正重要的地方,不是某一个跑分超过了 Nvidia。

OpenAI 正在把模型、产品、API、推理软件、芯片、内存、网络和数据中心连接起来。

模型在真实场景里遇到的问题,可以直接反馈给芯片团队;芯片获得的新能力,模型和软件又能马上针对它优化。

苹果曾经用类似的方法,把芯片、操作系统和硬件产品绑在一起,做出了很难被单点复制的体验。

OpenAI 现在想把这套逻辑搬到 AI 上:

AI 帮助设计芯片,芯片负责运行 AI,AI 再继续优化芯片上的程序。

这个循环一旦跑起来,真正可怕的可能不是第一代 Jalapeño 有多快,而是 Gen 2 和 Gen 3 会以什么速度进化。

真正的竞争开始了

现在就说 Nvidia 要凉,肯定太早。

这些数据由 OpenAI 使用公共基准测试并自行公布,还没有经过大规模生产环境的长期验证。芯片的制造成本、良率、整机成本和真实部署规模也没有公开。

OpenAI 自己也明确表示,未来仍会广泛部署 Nvidia 和其他合作伙伴的加速器,用于训练和推理。

原因很现实。

OpenAI 缺的不是某一种芯片,而是所有能够买到的算力。自家厨房刚开始试营业,没必要当场注销外卖账号。

但 OpenAI 和 Nvidia 之间的关系已经变了。

过去,OpenAI 主要是 Nvidia 的大客户。模型越大、使用量越高,就得购买更多 GPU。

现在,它开始有能力把规模最大、使用最频繁、最消耗运营成本的推理任务,逐步迁移到自己的芯片上。

Nvidia 的优势依然巨大,但它最大的客户正在学习自己造一部分铲子。

Jalapeño 还没有掀翻桌子。

它只是第一次把手伸进 Nvidia 的饭碗,而且已经夹走了一块不小的肉。

当模型公司开始掌握芯片,芯片公司也在向云服务和模型扩张,未来真正的竞争可能不再是哪一块芯片跑得更快。

而是谁能把模型、软件、芯片、网络和数据中心,组成一台效率最高的完整机器。

到那时,OpenAI 究竟还是 Nvidia 的客户,还是已经成了它最危险的竞争对手?

资料来源:https://openai.com/index/jalapeno-first-results/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
紧急提醒:黄金或将迎来翻倍前夜,这次机遇错过或许再等半世纪

紧急提醒:黄金或将迎来翻倍前夜,这次机遇错过或许再等半世纪

白浅娱乐聊
2026-09-18 09:05:39
100%赞同高志凯教授的建议,他提议:大陆应该在台湾招募有志青年

100%赞同高志凯教授的建议,他提议:大陆应该在台湾招募有志青年

霁寒飘雪
2026-09-18 11:48:51
湖底惊现39年前失踪的运钞车,钞箱毫发无损,撬开后却傻眼了

湖底惊现39年前失踪的运钞车,钞箱毫发无损,撬开后却傻眼了

青青会讲故事
2025-09-17 11:32:38
耻辱:中国男篮半场落后日本队19分,苏群的观点让人贻笑大方

耻辱:中国男篮半场落后日本队19分,苏群的观点让人贻笑大方

姜大叔侃球
2026-09-18 19:29:23
快退休的同事在与我交接工作时忽然翻脸:关系从来不是单方面的,反思自己的时候,也要看清局面

快退休的同事在与我交接工作时忽然翻脸:关系从来不是单方面的,反思自己的时候,也要看清局面

LULU生活家
2026-09-18 19:59:43
定居美国13年,回国捞金惨遭"驱逐",53岁活成了笑话

定居美国13年,回国捞金惨遭"驱逐",53岁活成了笑话

锅锅爱历史
2026-09-02 14:28:57
纽约股市三大股指18日涨跌不一

纽约股市三大股指18日涨跌不一

澎湃新闻
2026-09-19 06:07:05
敬一丹葬礼结束现场一片狼藉,女儿丈夫迟迟不肯离去,倪萍曝隐情

敬一丹葬礼结束现场一片狼藉,女儿丈夫迟迟不肯离去,倪萍曝隐情

古事寻踪记
2026-09-18 11:35:10
中国男篮19分输日本男篮,中国男足0-7日本男足,哪场失利更惨?

中国男篮19分输日本男篮,中国男足0-7日本男足,哪场失利更惨?

念洲
2026-09-18 20:46:37
CCTV5直播!国足VS马尔代夫,邵佳一掀起青春风暴,赵松源有望创历史

CCTV5直播!国足VS马尔代夫,邵佳一掀起青春风暴,赵松源有望创历史

篮球圈里的那些事
2026-09-18 14:52:35
晚年李作鹏每日无酒肉不欢,接受审查时还要求改善生活,吃肉喝酒?

晚年李作鹏每日无酒肉不欢,接受审查时还要求改善生活,吃肉喝酒?

浔阳咸鱼
2026-09-18 08:06:00
3个月内三位“金融副省长”回归金融系统!黄志强出任国开行行长,蔡东履新金融监管总局

3个月内三位“金融副省长”回归金融系统!黄志强出任国开行行长,蔡东履新金融监管总局

时代周报
2026-09-18 21:02:16
别被自媒体带偏!也门真实战况,根本不是胡塞已经一统全国

别被自媒体带偏!也门真实战况,根本不是胡塞已经一统全国

老马拉车莫少装
2026-09-18 12:17:11
曝85花和老公已离婚登上热搜,网友根据描述“对号入座”

曝85花和老公已离婚登上热搜,网友根据描述“对号入座”

韩小娱
2026-09-18 07:13:42
开售秒破亿!全球首款AI智能体手机发布,可一次执行多任务

开售秒破亿!全球首款AI智能体手机发布,可一次执行多任务

南方都市报
2026-09-16 23:38:08
马斯克Grok大赛10万美元冠军出炉:三眼独眼巨人,物理破绽藏不住

马斯克Grok大赛10万美元冠军出炉:三眼独眼巨人,物理破绽藏不住

算力游侠
2026-09-17 21:28:09
14年过去了,那个被骂“癞蛤蟆”的王大治,如今混成啥样了

14年过去了,那个被骂“癞蛤蟆”的王大治,如今混成啥样了

用外语夸女孩
2026-09-17 21:24:15
你在哪一刻意识到了贫富差距?网友:家庭累死累活一年收入不如朋友银行的利息

你在哪一刻意识到了贫富差距?网友:家庭累死累活一年收入不如朋友银行的利息

解读热点事件
2026-09-12 00:09:04
沉默45年,中国终于迎来第二轮“严打”!目标改变总体战正式打响

沉默45年,中国终于迎来第二轮“严打”!目标改变总体战正式打响

闻识
2026-05-04 08:59:03
陈伟霆何穗儿子周岁宴曝光,双方家人齐聚,简约家宴满是温情

陈伟霆何穗儿子周岁宴曝光,双方家人齐聚,简约家宴满是温情

海棠未眠a
2026-09-18 13:20:03
2026-09-19 06:55:00
AI范儿 incentive-icons
AI范儿
AI范儿是一个专注于人工智能领域的资讯和学习平台,提供最新的人工智能资讯
840文章数 684关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

体育要闻

好吧,中国男篮辛苦了

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

研发0.25亿理财26亿,敷尔佳豪赌三类器械

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

健康
亲子
时尚
手机
军事航空

脑动脉瘤的治疗方法,该选哪一种?

亲子要闻

小区里三个危险区一定要远离 #全国中小学生安全教育周 #儿童安全隐患 #关注儿童

直播|| 私藏几年的小众千元包,这5只越背越香!

手机要闻

实探苹果门店:iPhone 18 Pro Max黑色最早售罄

军事要闻

中方反对在安理会强推恢复对伊朗制裁

无障碍浏览 进入关怀版