网易首页 > 网易号 > 正文 申请入驻

OpenAI「掀桌」:自研推理芯片「墨西哥辣椒」跑赢英伟达

0
分享至

编辑|山辉、Youli

一觉醒来,关于 OpenAI 的消息真是满天飞。

先是 X 用户 Leo@synthwavedd 独家声称:OpenAI 已完成一次新的预训练,代号「Bel」,参数规模据称超过 10 万亿,或是 Doug 的继任者,可能成为 Astra /GPT-6 的基础模型……



一圈搜索下来发现,并没有准确的消息。但确凿无疑的是,OpenAI 的首款自研推理芯片出成绩了。

就在刚刚,OpenAI 公布了首款自研推理芯片 Jalapeño 的最新测试结果:取得了重大突破,这款芯片专为大语言模型推理设计,通过全新的架构设计,它能够同时提升吞吐量,并降低延迟,在保持高能效的同时,实现两者兼得。并在多个模型测试中超过 NVIDIA GB200、GB300 系统的效率表现。



随即,OpenAI CEO Sam Altman 也在 X 上表示:「我们制造了一款芯片,它的速度很快。」



需要注意的是,作为 OpenAI 首款自研推理芯片,Jalapeño 并不是用于训练下一代 GPT 模型的芯片,而是针对模型上线后的运行阶段进行优化。

简单来说:训练阶段是让模型学会能力,而推理阶段是让模型快速回答用户请求。Jalapeño 则主要解决的是第二个问题。

OpenAI 表示,传统硬件系统往往需要在两个指标之间做取舍:

  • 更高吞吐量(throughput):单位时间处理更多请求;
  • 更低延迟(latency):让用户更快得到响应。

例如,大规模批处理可以提升整体效率,但可能增加单次请求等待时间;而追求极低延迟,又可能牺牲资源利用率。Jalapeño 的目标,是在一个架构中同时优化两者。

而在具体性能方面,OpenAI 表示,在多个大模型推理测试中,Jalapeño 要优于 NVIDIA GB200 和 GB300 系统。其中测试模型包括:OpenAI GPT-OSS 120B; DeepSeek R1 670B; Moonshot AI Kimi K2.5 1T。



尤其引人注意的是DeepSeek R1 和 Kimi K2.5的出现,这似乎是在说明:Jalapeño 并不是只针对 OpenAI 自家模型优化,而是能够适配不同的大模型工作负载。

有意思的,Jalapeño 可被翻译为「墨西哥辣椒」,而在此消息一经发布后,也是立即引起了各路网友的调侃与热议。

「你打算用辣椒的名字来命名你的芯片吗?迫不及待想体验了。」



而对于 OpenAI 来说,Jalapeño 的推出,表明 OpenAI 正在尝试打通「模型 — 软件 — 芯片 — 数据中心」的一整条链路。

另外值得一提的是,此次 OpenAI 的 Jalapeño 芯片,在硬件上是与 Cerebras 进行的合作。

Tibo 发文称:「这一能力得益于我们与 Cerebras 建立的深度合作,以及他们独特的硬件架构。未来,这种合作还将进一步推动「超快速」体验的边界。

我非常期待双方继续合作,在 Cerebras 平台上不断突破极限,探索如何以最快速度运行我们能力最强的模型,并将这种体验带给对性能要求最高的客户。」



其实,OpenAI 并不是第一家走向自研芯片的 AI 公司。此前很多 AI 大厂也早已纷纷下场造芯。比如 Google 推出了 TPU; Amazon 开发 Trainium、Inferentia; Microsoft 推进 Maia; Meta 也布局自研 AI 加速器……

背后的逻辑非常类似:通用 GPU 足够灵活,但并非针对所有 AI 工作负载优化。对于每天运行海量 AI 请求的公司来说,如果能够针对自身模型、软件系统和服务方式设计芯片,就有机会进一步降低成本……

下面我们来具体看一看 Jalapeño 的能力。

更快,更省电

Jalapeño 的核心优势,是在相同功耗下完成更多 AI 工作,同时更快返回响应。现有系统通常需要在吞吐量和延迟之间取舍,而 Jalapeño 试图用同一套架构同时实现更高吞吐量和更低延迟。

OpenAI 强调,这种优势不仅出现在自家模型上,也覆盖外部开发的模型,证明 Jalapeño 是一套更通用的推理架构。

在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 三个公开模型上,Jalapeño 在峰值吞吐量下实现了 1.5~1.9 倍的每瓦 AI 工作量,端到端延迟降低至对比系统的 1/1.7~1/3.6;对于高度交互式的工作负载,性能优势达到 2.1~4.1 倍。



在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上,Jalapeño 的峰值每瓦吞吐量分别达到现有最佳系统的 1.9 倍、1.7 倍和 1.5 倍。

其中,在规模最大的 Kimi K2.5 上,Jalapeño 的峰值每瓦性能约提升 1.5 倍,端到端延迟降低约 3.4 倍。



在 Kimi K2.5 1T 上,随着单用户解码速度提高,Jalapeño 相比 GB300 的每瓦吞吐量优势从峰值的 1.5 倍扩大至最高 56.1 倍。

OpenAI 没有只比较单颗芯片的峰值性能,而是更关注一个指标:在满足用户和交互式 Agent 延迟要求的情况下,每单位电力能够完成多少有用的 AI 工作。

原因也和 Agent 有关。Agent 往往需要连续完成多个步骤,一次请求中看似不大的延迟,会在整个任务执行过程中不断累积。

这也是 Jalapeño 在低延迟区间表现最明显的地方。以 DeepSeek R1 为例,在对比系统此前最佳 TBT 对应的条件下,Jalapeño 每千瓦吞吐量达到 12,258 mixed TPS/kW,对比 GB300 的 118,相差约 104.3 倍。



在 DeepSeek R1 670B 上,Jalapeño 峰值每瓦吞吐量约为 GB300 的 1.7 倍;在相同解码速度下,优势最高扩大至 104.3 倍。

OpenAI 使用 SemiAnalysis 的公开基准 InferenceX 进行测试,并与目前领先的商用系统比较。从高吞吐量服务到高度交互、低延迟场景,Jalapeño 在三个公开模型上都实现了更好的每瓦性能和延迟组合,位于 Pareto frontier(帕累托前沿)。



在 DeepSeek R1 670B 的不同运行点上,Jalapeño 在每瓦吞吐量与交互速度、端到端延迟之间形成更优组合,处于 Pareto frontier(帕累托前沿)。

Jalapeño 的额定功耗为 700W,不过在此次测试的工作负载中,实际持续功耗始终保持在 550W 或以下。

为 Agent 而生

Jalapeño 从一开始就是围绕现在及未来大语言模型,尤其是交互式 Agent 设计的。

LLM 推理的不同阶段有不同瓶颈:Prefill 更依赖计算能力,Decode 更受内存带宽限制,核心和芯片之间的数据移动也会增加延迟。

因此,OpenAI 将芯片、内存、网络、软件和机架级系统协同设计。包括 KV Cache 在内的模型状态可以被明确放置并尽可能留在本地,让 Jalapeño 同时适应 Prefill 和 Decode,并随两者工作量的变化进行调整。

OpenAI 认为,这正是 Agent 工作负载的关键特征。

有意思的是,AI 不只是 Jalapeño 要服务的对象,也直接参与了这颗芯片的开发。

借助不同阶段的模型,OpenAI 团队从最初设计到 Tape-out(流片设计定稿)只用了 9 个月。模型被用于探索不同实现、缩短设计、测量和验证周期,还参与优化芯片的算术电路。

Jalapeño 同样被设计成一个对人类和模型都清晰、可预测的编程目标。使用 GPT-Astra 驱动的 Codex,团队只用了 2 个月,就让三款原本不在 Jalapeño 初始生产计划中的开放权重模型实现了高性能运行。

在部分 GPT-OSS Attention 和 MoE 模块中,Codex 生成的实现甚至比原有人类专家手写版本快 1.5~1.8 倍。

年底部署,二代三代已经在路上

OpenAI 计划在 2026 年底前开始将 Jalapeño 部署到自己的计算基础设施中。目前团队仍在进行生产验证、完善软件、为大规模运行做准备,并继续在更多模型上验证性能。

后续的产品也已经启动,Gen 2 已经进入深度开发阶段,Gen 3 也已经开始成形。

OpenAI 将 Jalapeño 带来的效率变化总结成了三个档位:Ultra-fast 模式,可以达到过去只有 Fast 模式才有的效率;Fast 模式,可以达到过去只有 Batch 模式才有的效率;Batch 模式本身则进一步提高效率。

不过,自研芯片并不意味着 OpenAI 准备摆脱 NVIDIA。

OpenAI 明确表示,满足不断增长的 AI 需求,需要来自所有可用来源的更多算力,公司仍将继续大规模部署 NVIDIA 和其他合作伙伴的加速器,同时覆盖训练和推理工作负载。

你怎么看?欢迎评论区留言、交流!

参考链接:

https://x.com/OpenAI/status/2092300846675505602

https://x.com/sama/status/2092339694210040187

https://openai.com/index/jalapeno-first-results/

https://techcrunch.com/2026/08/25/openais-jalapeno-chip-is-built-for-fast-inference-at-scale-benchmarks-show/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
苹果官网更新iPhone 18系列和iPhone Duo国行售价

苹果官网更新iPhone 18系列和iPhone Duo国行售价

财闻
2026-09-10 02:41:45
中国女篮险胜波多黎各晋级世界杯八强

中国女篮险胜波多黎各晋级世界杯八强

新京报
2026-09-10 07:34:34
长沙男童“摸臀”事件:当事女主要的不是对不起,而是一场盛大的发布会

长沙男童“摸臀”事件:当事女主要的不是对不起,而是一场盛大的发布会

News脑洞
2026-09-09 15:46:08
胖东来,一个开超市的跑去建楼,耗资65亿,把整个建筑行业的脸都打肿了:按时给钱、真材实料、给工人装空调!

胖东来,一个开超市的跑去建楼,耗资65亿,把整个建筑行业的脸都打肿了:按时给钱、真材实料、给工人装空调!

谭谈社会
2026-09-09 23:50:25
女篮世界杯8强对阵出炉!中国女篮进入天堂半区,晋级四强有戏了

女篮世界杯8强对阵出炉!中国女篮进入天堂半区,晋级四强有戏了

侃球熊弟
2026-09-10 01:34:38
“长沙摸臀案”舆论升级!知名作家陈岚称,如果发生在美国,遇到的处理方式是以保护未成年人的角度出发的

“长沙摸臀案”舆论升级!知名作家陈岚称,如果发生在美国,遇到的处理方式是以保护未成年人的角度出发的

火山詩话
2026-09-09 07:30:38
草根演员王新昉猝然离世,年仅55岁,儿子:他生意失败后转行跑龙套,在西安拍短剧时死在出租屋

草根演员王新昉猝然离世,年仅55岁,儿子:他生意失败后转行跑龙套,在西安拍短剧时死在出租屋

极目新闻
2026-09-09 22:06:15
一场1-2!输球不可怕,更可怕的是赛后郑钦文这番话:让人很揪心

一场1-2!输球不可怕,更可怕的是赛后郑钦文这番话:让人很揪心

江启
2026-09-10 05:46:45
碰瓷4岁幼童的小仙女陈锦婷真容曝光!普通路人一个,和美颜照片差距感拉满

碰瓷4岁幼童的小仙女陈锦婷真容曝光!普通路人一个,和美颜照片差距感拉满

小徐讲八卦
2026-09-10 06:24:52
京东家电家居线下升级

京东家电家居线下升级

巨潮WAVE
2026-08-15 08:02:09
利物浦哭晕?1.25亿欧新援加盟后首次先发即伤退!3次吐饼+失单刀

利物浦哭晕?1.25亿欧新援加盟后首次先发即伤退!3次吐饼+失单刀

我爱英超
2026-09-10 05:09:11
61岁著名民俗学者、南京师范大学教授白莉逝世

61岁著名民俗学者、南京师范大学教授白莉逝世

澎湃新闻
2026-09-09 22:42:27
再见17!iPhone18彻底补全所有短板,刚买17的人心态崩了

再见17!iPhone18彻底补全所有短板,刚买17的人心态崩了

小柱解说游戏
2026-09-09 02:05:46
尴尬名场面!赵一鸣官宣“称错赔十倍”没多久,门店称重翻车,17个小面包收65.98元,网友拿到335元赔付

尴尬名场面!赵一鸣官宣“称错赔十倍”没多久,门店称重翻车,17个小面包收65.98元,网友拿到335元赔付

火山詩话
2026-09-10 06:24:25
曝网红“深圳六哥”去世!年仅47岁,欠大几百万,张大炮还有30万

曝网红“深圳六哥”去世!年仅47岁,欠大几百万,张大炮还有30万

裕丰娱间说
2026-09-10 06:27:50
多问一嘴真的能改变命运!网友:真心佩服这种脑子灵光转得快的人

多问一嘴真的能改变命运!网友:真心佩服这种脑子灵光转得快的人

夜深爱杂谈
2026-09-09 20:42:11
24999元!华为新机官宣:9月12日,正式开售!

24999元!华为新机官宣:9月12日,正式开售!

科技堡垒
2026-09-08 11:20:02
女篮晋级八强宫鲁鸣却成笑话!最后25秒叫出唯一暂停,还是王思雨提醒的

女篮晋级八强宫鲁鸣却成笑话!最后25秒叫出唯一暂停,还是王思雨提醒的

篮球资讯达人
2026-09-10 02:15:07
社评:欧盟若铁了心要跟中国打贸易战,那就试试吧

社评:欧盟若铁了心要跟中国打贸易战,那就试试吧

环球网资讯
2026-09-10 00:29:09
AI生成视频攻破人脸识别系统!特大新型网络犯罪案宣判,36人获刑,涉案723万余元

AI生成视频攻破人脸识别系统!特大新型网络犯罪案宣判,36人获刑,涉案723万余元

河南交通广播1041
2026-09-09 13:23:22
2026-09-10 10:55:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13958文章数 142731关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

牛弹琴:美官员涉华谎言让全世界看笑话 鲁比奥都不信

头条要闻

牛弹琴:美官员涉华谎言让全世界看笑话 鲁比奥都不信

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲被处罚2天,身边人传出好消息

财经要闻

银行新高!新一轮周期,刚开始!

汽车要闻

腾势Z9GT易三方闪充尊越型32.98万元上市

态度原创

教育
健康
游戏
本地
公开课

教育要闻

如果早有准备,就不至于这么难嘛

中风康复为何像“抽丝剥茧”?

《异度之刃3》NS2新增内容:4K60帧 新美少女英雄!

本地新闻

宁波,中国制造的隐藏大佬

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版