网易首页 > 网易号 > 正文 申请入驻

OpenAI亮出自研芯片进展:端到端延迟砍掉超70%,速度超英伟达GB300

0
分享至


芯东西(公众号:aichip001)
编译 崔嫄伟
编辑 陈骏达

芯东西8月26日消息,昨日,OpenAI对外公布其首款定制推理芯片Jalapeño的实测性能结果。测试表明,Jalapeño能够在单位功耗下完成更多AI推理任务,同时显著降低请求端到端延迟。对业务侧而言,这意味着随着业务需求扩张,用户可以获得更快响应速度、更高服务吞吐以及更稳定的访问体验。

Jalapeño的性能在GPT‑OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T三款模型上均得到验证,证明该架构既可以适配OpenAI自研模型,也能够支持外部开源大模型。在三款模型的测试条件下,峰值吞吐量场景下,Jalapeño每瓦可完成的AI任务量达到参考商用推理系统的1.5‑1.9倍,端到端延迟可缩减41%‑72%;针对高交互类工作负载,性能提升可达2.1‑4.1倍。

OpenAI自身大模型技术深度参与了Jalapeño的全流程研发。早期AI模型辅助团队完成芯片方案探索与设计验证,团队仅用时9个月便完成从初步架构设计到芯片流片的完整流程;新一代模型则进一步加速芯片的性能调优与软件编程工作。

一、单芯片架构设计:平衡推理速度与能效

Jalapeño的设计面向下一代大语言模型,尤其聚焦智能体高交互推理场景,核心目标是AI交互中高吞吐量与低延迟难以兼顾的行业痛点。

大模型推理分为两个核心阶段,预填充(Prefill)和解码(Decode),二者的性能瓶颈存在明显差异。预填充阶段负责处理用户输入提示词,属于算力密集型计算阶段;解码阶段则由模型逐Token生成回复,性能瓶颈主要来自内存带宽。推理运行过程中,数据在计算核心与存储单元之间的搬运会产生通信延迟,造成计算单元等待,通信开销甚至会抵消计算带来的性能收益。

推理运行过程中,数据在计算核心与存储单元之间的搬运会产生通信延迟,造成计算单元等待,通信开销甚至会抵消计算带来的性能收益。

Jalapeño的核心设计思路是最大限度削减数据搬运与通信延迟。该芯片支持将模型状态(包含生成回复必需的KV缓存)显式固定在本地存储;系统可以针对每一个推理阶段,动态调配算力、内存、网络资源组合。

网络是这套架构不可分割的组成部分。通过这套互联网络设计,全部计算任务可以在一套相互连通的硬件系统内完成,尽可能减少跨设备的数据搬运,保障每一条推理请求从接收至处理完毕,全程保持高速高效。

这套架构最终实现了一套均衡、高可适配的推理加速器:既能够适配不断迭代的各类模型架构,在预填充、解码两个阶段均具备优异性能,也可适配智能体场景下预填充与解码负载占比动态变化的工作负载。

二、用AI设计芯片,芯片也面向AI编程

AI深度介入Jalapeño的研发全过程。借助AI工具探索多样化实现方案,压缩设计‑测试‑验证迭代周期,并基于真实模型负载持续优化。AI同时参与芯片算术运算电路优化,帮助团队按期在芯片内集成更多计算算力。

Jalapeño的编程接口简洁、行为具备可预测性,同时适配人类工程师与AI程序。工程师可通过本地张量、显式通信、确定性同步完成计算任务描述;AI则负责完成任务在整套硬件系统上的映射、数据放置、资源调度与多组件协同。这套确定性的架构抽象,让AI得以攻克传统并行编程的复杂难题。

即便硬件架构具备灵活性,适配全新模型依旧需要开发对应内核和完成模型专属优化。OpenAI借助Codex搭配GPT‑Astra,仅用两个月时间,就让三款原本不在Jalapeño初始量产规划内的开源权重模型(GPT‑OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T)实现高性能运行。这既体现了硬件架构的灵活度,也印证了AI辅助编程的工程效率。

针对GPT‑OSS的部分注意力模块与混合专家(MoE)模块,AI生成的算子实现代码性能较人类专家手写代码提升1.5‑1.8倍。该结果仅针对选定模块,并非完整模型,但预示了全新的芯片软件迭代范式。

三、基准测试:三款公开模型下性能表现优异

为客观评估Jalapeño的实际推理表现,OpenAI采用SemiAnalysis公开基准测试套件InferenceX,该工具可完整模拟AI请求全流程服务行为,将Jalapeño与英伟达GB200 STP和GB300 STP做横向对比,覆盖高吞吐量批量服务、高交互低延迟等全部典型推理场景。

测试结果显示,在GPT‑OSS‑120B、DeepSeek R1‑670B两款模型测试中,Jalapeño性能曲线处于帕累托最优前沿。

针对GPT‑OSS‑120B模型,对比GB200 STP,Jalapeño的每千瓦混合吞吐在单用户解码速度、端到端请求延迟维度均具备优势;高交互负载下能效优势进一步放大,相近吞吐水平下,端到端延迟可缩减约76%,兼顾整体吞吐量的同时实现更快交互响应。


针对DeepSeek R1‑670B模型,对比GB300 STP,Jalapeño同样在上述两项指标上表现更优;高交互负载下能效优势进一步放大,相近吞吐水平下,端到端延迟可缩减约80%,兼顾整体吞吐量的同时实现更快交互响应。


在与现有最优加速器保持同等最高单用户解码速度的条件下,Jalapeño在GPT‑OSS‑120B、DeepSeek R1、Kimi K2.5三款模型上,每千瓦混合token吞吐分别达到对比方案的53.7倍、104.3倍、56.1倍,高能效优势十分突出。


Jalapeño在GPT‑OSS‑120B、DeepSeek R1‑670B、Kimi K2.5‑1T三款模型上,单用户峰值生成速度分别达到1459、700、694token/s/user,相较现有最优加速器分别提升至2.7倍、4.1倍、3.8倍,在参数量更大的模型场景中,交互响应速度的优势更为突出。


在各平台最优运行条件下,Jalapeño在GPT‑OSS‑120B、DeepSeek R1‑670B、Kimi K2.5‑1T三款模型上,峰值每千瓦混合token吞吐相较现有最优加速器分别提升至1.9倍、1.7倍、1.5倍,展现出全面领先的能效水平。


在三款公开模型的测试范围内,Jalapeño在单位功耗性能与延迟指标上实现更优组合,达到帕累托最优前沿。为保证对比公平,测试按照各加速器官方标称功耗完成归一化处理。Jalapeño标称功耗700瓦,在本次测试负载下,实际持续运行功耗不超过550瓦。

Jalapeño在GPT‑OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T上均展现出优秀性能。在测试规模最大的公开模型Kimi K2.5 1T上,对比参考系统,Jalapeño峰值每瓦性能提升至约1.5倍,端到端延迟缩减约71%。内部测试显示,面对OpenAI自研前沿模型时,Jalapeño的性能优势会进一步放大。这表明,随着模型负载规模扩大、算力需求提升,该架构的价值将更加凸显。

结语:自研芯片重塑AI推理基础设施

AI基础设施的核心价值,是完成现实场景下的有效计算任务。Jalapeño能够在同等功耗与硬件条件下完成更多有效推理计算,承载更大规模业务需求,降低AI服务交付成本。以Jalapeño为代表的自研推理芯片,有望凭借极低的交互响应时延,拓展智能体的落地应用边界。

同时,Jalapeño也展现出全栈协同设计与AI辅助硬件开发的全新范式。从芯片架构、存储网络设计,到算子内核的自动化生成,AI不再仅仅是被芯片运行的业务对象,更深度参与硬件研发与软件适配全流程。这一模式也为行业提供参考:面向智能体时代的推理硬件,需要兼顾硬件架构的确定性与软件层面的AI赋能,才能更好适配模型快速迭代带来的负载变化。未来随着多代芯片平台持续演进,也将进一步推动大模型推理效率与智能体应用的持续突破。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
穆里尼奥头号难题!皇马绝对核心彻底摆烂!昔日王牌拖垮全队

穆里尼奥头号难题!皇马绝对核心彻底摆烂!昔日王牌拖垮全队

澜归序
2026-09-15 09:42:05
"野人先生冷处理"冲上热搜 记者实探门店!

"野人先生冷处理"冲上热搜 记者实探门店!

看看新闻Knews
2026-09-14 23:41:54
美网官宣对5人开出罚单!萨巴伦卡遭罚款7500美元 丢冠后砸拍泄愤

美网官宣对5人开出罚单!萨巴伦卡遭罚款7500美元 丢冠后砸拍泄愤

我爱英超
2026-09-15 06:58:05
下一个许家印?地产老总暴雷,欠1065亿仅是冰山一角,害惨老百姓

下一个许家印?地产老总暴雷,欠1065亿仅是冰山一角,害惨老百姓

说故事的阿袭
2026-09-15 09:20:43
物业起诉你欠物业费?法官问为啥不交,记住用这三句话回答

物业起诉你欠物业费?法官问为啥不交,记住用这三句话回答

小鹿姐姐情感说
2026-09-02 00:13:46
孟晚舟事件八年后,华为纽约刑事审判开庭

孟晚舟事件八年后,华为纽约刑事审判开庭

出海湃
2026-09-14 18:26:05
人不会无缘无故患上鼻炎!研究发现:得鼻炎的人,背后有5个因素

人不会无缘无故患上鼻炎!研究发现:得鼻炎的人,背后有5个因素

健康之光
2026-09-14 19:50:15
裁员名单念到我工号,我二话没说签字离场,人事总监追来,见我接了猎头电话后目瞪口呆

裁员名单念到我工号,我二话没说签字离场,人事总监追来,见我接了猎头电话后目瞪口呆

一口娱乐
2026-09-15 00:16:21
他曾杀害数千红军及军长,故居却一度成景区被洗白,如今终于被摘牌

他曾杀害数千红军及军长,故居却一度成景区被洗白,如今终于被摘牌

史不语
2026-09-13 13:00:03
炸裂大瓜!网传南宁骑行圈一男子与小三多次发布情侣款亲密合照,还让孩子叫干妈,妻子哭诉发帖引热议

炸裂大瓜!网传南宁骑行圈一男子与小三多次发布情侣款亲密合照,还让孩子叫干妈,妻子哭诉发帖引热议

火山詩话
2026-09-14 18:29:14
178万成交!这样的1角纸币,再破都值钱!

178万成交!这样的1角纸币,再破都值钱!

天天纪念币
2026-08-09 10:05:46
我们需要警惕一种情形:美国AI巨头的“减速论”,可能会对开源模型构成实质性绞杀

我们需要警惕一种情形:美国AI巨头的“减速论”,可能会对开源模型构成实质性绞杀

锦缎研究院
2026-09-15 07:51:51
“罗永浩说野人先生难吃”冲上热搜,店员回应:不知道罗永浩是谁,价格偏贵应该是品牌的定义

“罗永浩说野人先生难吃”冲上热搜,店员回应:不知道罗永浩是谁,价格偏贵应该是品牌的定义

极目新闻
2026-09-15 12:16:02
查尔斯灵魂伴侣病逝!享年75岁,儿子证实:跟国王的恋情被人破坏

查尔斯灵魂伴侣病逝!享年75岁,儿子证实:跟国王的恋情被人破坏

章媸解说体育
2026-09-14 15:57:28
终于有家长看不下去出来怼了,网友:他做了我一直想做不敢做的事

终于有家长看不下去出来怼了,网友:他做了我一直想做不敢做的事

夜深爱杂谈
2026-09-14 20:03:34
400名运动员紧急撤离?日本亚运会遭暴雨冲击,距开幕仅剩10天

400名运动员紧急撤离?日本亚运会遭暴雨冲击,距开幕仅剩10天

探索新高度
2026-09-14 20:04:08
小学生作文《热死了》走红,老师看后直接给满分:我拜你为师吧!

小学生作文《热死了》走红,老师看后直接给满分:我拜你为师吧!

谭老师地理大课堂
2026-08-13 01:17:31
iPhone 17,突然大降价!

iPhone 17,突然大降价!

上观新闻
2026-09-12 14:30:50
西恩·潘炮轰特朗普对乌立场,还喊伊万卡夫妇去看他的乌克兰纪录片

西恩·潘炮轰特朗普对乌立场,还喊伊万卡夫妇去看他的乌克兰纪录片

桂系007
2026-09-14 20:50:53
27岁泽君茹,受聘为211高校特聘副教授

27岁泽君茹,受聘为211高校特聘副教授

深圳晚报
2026-09-14 20:37:49
2026-09-15 12:47:00
芯东西 incentive-icons
芯东西
智东西AI媒体矩阵品牌。芯东西,芯片产业新媒体。我们是一群追芯人,专注报道AI芯片和半导体产业创新。
2595文章数 8160关注度
往期回顾 全部

科技要闻

芯片产业链蒸发超5000亿美元,特朗普大怒

头条要闻

娃哈哈虎林工厂房产被查封:100多人被欠缴200万公积金

头条要闻

娃哈哈虎林工厂房产被查封:100多人被欠缴200万公积金

体育要闻

英格兰业余门将,拒绝去非洲当国王

娱乐要闻

她是敬一丹女儿,把公益当事业

财经要闻

未来五年,电子信息制造业发展规划出炉

汽车要闻

纯电续航960km/迪迪虾上车 腾势N8L纯电售29.98万元起

态度原创

手机
艺术
家居
房产
数码

手机要闻

卢伟冰称有史以来最大一次升级,小米18 PRO系列本月发布

艺术要闻

她是影后级女演员,下班后遛鸟、养狗,租房住也很快乐

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

最新数据出炉:三亚房价,稳住了!

数码要闻

惠普战X Pro锐龙版上市:锐龙AI 9 HX Pro 470,29999元

无障碍浏览 进入关怀版