网易首页 > 网易号 > 正文 申请入驻

OpenAI「掀桌」:自研推理芯片「墨西哥辣椒」跑赢英伟达

0
分享至

编辑|山辉、Youli

一觉醒来,关于 OpenAI 的消息真是满天飞。

先是 X 用户 Leo@synthwavedd 独家声称:OpenAI 已完成一次新的预训练,代号「Bel」,参数规模据称超过 10 万亿,或是 Doug 的继任者,可能成为 Astra /GPT-6 的基础模型……



一圈搜索下来发现,并没有准确的消息。但确凿无疑的是,OpenAI 的首款自研推理芯片出成绩了。

就在刚刚,OpenAI 公布了首款自研推理芯片 Jalapeño 的最新测试结果:取得了重大突破,这款芯片专为大语言模型推理设计,通过全新的架构设计,它能够同时提升吞吐量,并降低延迟,在保持高能效的同时,实现两者兼得。并在多个模型测试中超过 NVIDIA GB200、GB300 系统的效率表现。



随即,OpenAI CEO Sam Altman 也在 X 上表示:「我们制造了一款芯片,它的速度很快。」



需要注意的是,作为 OpenAI 首款自研推理芯片,Jalapeño 并不是用于训练下一代 GPT 模型的芯片,而是针对模型上线后的运行阶段进行优化。

简单来说:训练阶段是让模型学会能力,而推理阶段是让模型快速回答用户请求。Jalapeño 则主要解决的是第二个问题。

OpenAI 表示,传统硬件系统往往需要在两个指标之间做取舍:

  • 更高吞吐量(throughput):单位时间处理更多请求;
  • 更低延迟(latency):让用户更快得到响应。

例如,大规模批处理可以提升整体效率,但可能增加单次请求等待时间;而追求极低延迟,又可能牺牲资源利用率。Jalapeño 的目标,是在一个架构中同时优化两者。

而在具体性能方面,OpenAI 表示,在多个大模型推理测试中,Jalapeño 要优于 NVIDIA GB200 和 GB300 系统。其中测试模型包括:OpenAI GPT-OSS 120B; DeepSeek R1 670B; Moonshot AI Kimi K2.5 1T。



尤其引人注意的是DeepSeek R1 和 Kimi K2.5的出现,这似乎是在说明:Jalapeño 并不是只针对 OpenAI 自家模型优化,而是能够适配不同的大模型工作负载。

有意思的,Jalapeño 可被翻译为「墨西哥辣椒」,而在此消息一经发布后,也是立即引起了各路网友的调侃与热议。

「你打算用辣椒的名字来命名你的芯片吗?迫不及待想体验了。」



而对于 OpenAI 来说,Jalapeño 的推出,表明 OpenAI 正在尝试打通「模型 — 软件 — 芯片 — 数据中心」的一整条链路。

另外值得一提的是,此次 OpenAI 的 Jalapeño 芯片,在硬件上是与 Cerebras 进行的合作。

Tibo 发文称:「这一能力得益于我们与 Cerebras 建立的深度合作,以及他们独特的硬件架构。未来,这种合作还将进一步推动「超快速」体验的边界。

我非常期待双方继续合作,在 Cerebras 平台上不断突破极限,探索如何以最快速度运行我们能力最强的模型,并将这种体验带给对性能要求最高的客户。」



其实,OpenAI 并不是第一家走向自研芯片的 AI 公司。此前很多 AI 大厂也早已纷纷下场造芯。比如 Google 推出了 TPU; Amazon 开发 Trainium、Inferentia; Microsoft 推进 Maia; Meta 也布局自研 AI 加速器……

背后的逻辑非常类似:通用 GPU 足够灵活,但并非针对所有 AI 工作负载优化。对于每天运行海量 AI 请求的公司来说,如果能够针对自身模型、软件系统和服务方式设计芯片,就有机会进一步降低成本……

下面我们来具体看一看 Jalapeño 的能力。

更快,更省电

Jalapeño 的核心优势,是在相同功耗下完成更多 AI 工作,同时更快返回响应。现有系统通常需要在吞吐量和延迟之间取舍,而 Jalapeño 试图用同一套架构同时实现更高吞吐量和更低延迟。

OpenAI 强调,这种优势不仅出现在自家模型上,也覆盖外部开发的模型,证明 Jalapeño 是一套更通用的推理架构。

在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 三个公开模型上,Jalapeño 在峰值吞吐量下实现了 1.5~1.9 倍的每瓦 AI 工作量,端到端延迟降低至对比系统的 1/1.7~1/3.6;对于高度交互式的工作负载,性能优势达到 2.1~4.1 倍。



在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上,Jalapeño 的峰值每瓦吞吐量分别达到现有最佳系统的 1.9 倍、1.7 倍和 1.5 倍。

其中,在规模最大的 Kimi K2.5 上,Jalapeño 的峰值每瓦性能约提升 1.5 倍,端到端延迟降低约 3.4 倍。



在 Kimi K2.5 1T 上,随着单用户解码速度提高,Jalapeño 相比 GB300 的每瓦吞吐量优势从峰值的 1.5 倍扩大至最高 56.1 倍。

OpenAI 没有只比较单颗芯片的峰值性能,而是更关注一个指标:在满足用户和交互式 Agent 延迟要求的情况下,每单位电力能够完成多少有用的 AI 工作。

原因也和 Agent 有关。Agent 往往需要连续完成多个步骤,一次请求中看似不大的延迟,会在整个任务执行过程中不断累积。

这也是 Jalapeño 在低延迟区间表现最明显的地方。以 DeepSeek R1 为例,在对比系统此前最佳 TBT 对应的条件下,Jalapeño 每千瓦吞吐量达到 12,258 mixed TPS/kW,对比 GB300 的 118,相差约 104.3 倍。



在 DeepSeek R1 670B 上,Jalapeño 峰值每瓦吞吐量约为 GB300 的 1.7 倍;在相同解码速度下,优势最高扩大至 104.3 倍。

OpenAI 使用 SemiAnalysis 的公开基准 InferenceX 进行测试,并与目前领先的商用系统比较。从高吞吐量服务到高度交互、低延迟场景,Jalapeño 在三个公开模型上都实现了更好的每瓦性能和延迟组合,位于 Pareto frontier(帕累托前沿)。



在 DeepSeek R1 670B 的不同运行点上,Jalapeño 在每瓦吞吐量与交互速度、端到端延迟之间形成更优组合,处于 Pareto frontier(帕累托前沿)。

Jalapeño 的额定功耗为 700W,不过在此次测试的工作负载中,实际持续功耗始终保持在 550W 或以下。

为 Agent 而生

Jalapeño 从一开始就是围绕现在及未来大语言模型,尤其是交互式 Agent 设计的。

LLM 推理的不同阶段有不同瓶颈:Prefill 更依赖计算能力,Decode 更受内存带宽限制,核心和芯片之间的数据移动也会增加延迟。

因此,OpenAI 将芯片、内存、网络、软件和机架级系统协同设计。包括 KV Cache 在内的模型状态可以被明确放置并尽可能留在本地,让 Jalapeño 同时适应 Prefill 和 Decode,并随两者工作量的变化进行调整。

OpenAI 认为,这正是 Agent 工作负载的关键特征。

有意思的是,AI 不只是 Jalapeño 要服务的对象,也直接参与了这颗芯片的开发。

借助不同阶段的模型,OpenAI 团队从最初设计到 Tape-out(流片设计定稿)只用了 9 个月。模型被用于探索不同实现、缩短设计、测量和验证周期,还参与优化芯片的算术电路。

Jalapeño 同样被设计成一个对人类和模型都清晰、可预测的编程目标。使用 GPT-Astra 驱动的 Codex,团队只用了 2 个月,就让三款原本不在 Jalapeño 初始生产计划中的开放权重模型实现了高性能运行。

在部分 GPT-OSS Attention 和 MoE 模块中,Codex 生成的实现甚至比原有人类专家手写版本快 1.5~1.8 倍。

年底部署,二代三代已经在路上

OpenAI 计划在 2026 年底前开始将 Jalapeño 部署到自己的计算基础设施中。目前团队仍在进行生产验证、完善软件、为大规模运行做准备,并继续在更多模型上验证性能。

后续的产品也已经启动,Gen 2 已经进入深度开发阶段,Gen 3 也已经开始成形。

OpenAI 将 Jalapeño 带来的效率变化总结成了三个档位:Ultra-fast 模式,可以达到过去只有 Fast 模式才有的效率;Fast 模式,可以达到过去只有 Batch 模式才有的效率;Batch 模式本身则进一步提高效率。

不过,自研芯片并不意味着 OpenAI 准备摆脱 NVIDIA。

OpenAI 明确表示,满足不断增长的 AI 需求,需要来自所有可用来源的更多算力,公司仍将继续大规模部署 NVIDIA 和其他合作伙伴的加速器,同时覆盖训练和推理工作负载。

你怎么看?欢迎评论区留言、交流!

参考链接:

https://x.com/OpenAI/status/2092300846675505602

https://x.com/sama/status/2092339694210040187

https://openai.com/index/jalapeno-first-results/

https://techcrunch.com/2026/08/25/openais-jalapeno-chip-is-built-for-fast-inference-at-scale-benchmarks-show/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
贾斯汀·比伯与海莉·比伯床上亲密大片曝光

贾斯汀·比伯与海莉·比伯床上亲密大片曝光

追星雷达站
2026-09-08 05:03:31
“一个月陪睡一两次”:网红魏莹的榜一大哥照片曝光,他身价过亿,是个大企业家

“一个月陪睡一两次”:网红魏莹的榜一大哥照片曝光,他身价过亿,是个大企业家

江山挥笔
2026-08-25 16:40:36
一声惊雷!湖南老牌汽车经销集团停摆,员工只拿80%最低工资,曾多次入选百强榜

一声惊雷!湖南老牌汽车经销集团停摆,员工只拿80%最低工资,曾多次入选百强榜

火山詩话
2026-09-10 13:20:23
iPhone,打工人买不起了?

iPhone,打工人买不起了?

中国新闻周刊
2026-09-10 12:17:59
长达3小时10分钟的闭门密谈后,美方方案被披露:克里米亚划归俄罗斯,乌克兰须在宪法中承诺永不加入北约

长达3小时10分钟的闭门密谈后,美方方案被披露:克里米亚划归俄罗斯,乌克兰须在宪法中承诺永不加入北约

人生录
2026-09-10 00:05:15
确认了: 两人已离婚!未签婚前协议, 400多亿元财产待分割

确认了: 两人已离婚!未签婚前协议, 400多亿元财产待分割

广州生活美食圈
2026-09-09 20:31:07
从135到98,肚子瘪下去才明白:内脏脂肪最怕的,从来不是跑步

从135到98,肚子瘪下去才明白:内脏脂肪最怕的,从来不是跑步

健身狂人
2026-09-06 02:07:39
厄尔尼诺已形成、或达超强级别:今年冬天,请把这三件事提前办了

厄尔尼诺已形成、或达超强级别:今年冬天,请把这三件事提前办了

墨兰史书
2026-09-10 15:20:07
“吊瓶班”学生无一人考上一本:表演式努力骗人骗己

“吊瓶班”学生无一人考上一本:表演式努力骗人骗己

兵卒史
2026-09-10 10:59:48
中小学生流行“吃作业”?多地紧急提醒:可能危害孩子健康!

中小学生流行“吃作业”?多地紧急提醒:可能危害孩子健康!

闪电新闻
2026-09-10 18:16:45
CBA最新消息!NBA后卫或加盟广东宏远,琼斯重返中国赛场

CBA最新消息!NBA后卫或加盟广东宏远,琼斯重返中国赛场

体坛瞎白话
2026-09-10 08:18:39
我领馆提醒:所有计划前往的中国游客,取消行程!

我领馆提醒:所有计划前往的中国游客,取消行程!

第一财经资讯
2026-09-06 17:17:43
江苏淮安一男子称“部分洋河梦之蓝放地库14年只剩空瓶”,厂家回应:出现这样问题的原因有很多,有可能是储存问题,目前正在积极沟通

江苏淮安一男子称“部分洋河梦之蓝放地库14年只剩空瓶”,厂家回应:出现这样问题的原因有很多,有可能是储存问题,目前正在积极沟通

台州交通广播
2026-09-10 13:10:29
专家警告:每天吃一根玉米,就等于给心脏“踩刹车”?真相来了

专家警告:每天吃一根玉米,就等于给心脏“踩刹车”?真相来了

芹姐说生活
2026-09-09 23:41:21
10月1日起!每家备好三样东西,不是囤货,保全家秋冬安稳

10月1日起!每家备好三样东西,不是囤货,保全家秋冬安稳

苗苗情感说
2026-09-10 08:30:28
大四女生被强制要求搬宿舍 不肯搬就半夜砸开门锁?校方回应:实在没有办法才请求大家 不存在强制

大四女生被强制要求搬宿舍 不肯搬就半夜砸开门锁?校方回应:实在没有办法才请求大家 不存在强制

闪电新闻
2026-09-10 17:58:08
韩旭谈对阵法国女篮:我们队伍年轻,但她们在奥运会是第二

韩旭谈对阵法国女篮:我们队伍年轻,但她们在奥运会是第二

懂球帝
2026-09-10 03:40:29
美国使馆晒出投降照片摊上事了,日本人集体暴怒,要求美方来道歉

美国使馆晒出投降照片摊上事了,日本人集体暴怒,要求美方来道歉

江启
2026-09-08 14:58:00
吴柳芳:我没刘翔那命,只能16万买断

吴柳芳:我没刘翔那命,只能16万买断

亚哥谈古论今
2026-09-02 20:27:30
吴柳芳吐槽直播带货不理想,原因是男粉占比90%以上,消费欲不高!遭网友怒怼:个个都想卖货,我买得完吗?

吴柳芳吐槽直播带货不理想,原因是男粉占比90%以上,消费欲不高!遭网友怒怼:个个都想卖货,我买得完吗?

谭谈社会
2026-09-10 17:28:50
2026-09-10 20:12:54
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13961文章数 142731关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

初二女生楼道遭殴打 公安局长通宵审问刑拘2人行拘3人

头条要闻

初二女生楼道遭殴打 公安局长通宵审问刑拘2人行拘3人

体育要闻

一年丢掉的积分排名,郑钦文用18天找回来

娱乐要闻

参加晚宴,刘亦菲因合照深陷争议

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

大六座+千匹马力+71度大电池 阿维塔T09曝光/年内上市

态度原创

游戏
教育
房产
亲子
家居

粉丝众望所归,《阿斯加德的陨落》1.0正式版于2026年9月9日上线Steam

教育要闻

一个视频看懂蝴蝶模型,巧求长方形面积!

房产要闻

别不服!海南的亿万富豪,只有不到300个!

亲子要闻

喝酒喝醉的我见过 吃饭醉了的还是头回见 网友:快让孩子睡会吧

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版