网易首页 > 网易号 > 正文 申请入驻

OpenAI亮出自研芯片进展:端到端延迟砍掉超70%,速度超英伟达GB300

0
分享至


芯东西(公众号:aichip001)
编译 崔嫄伟
编辑 陈骏达

芯东西8月26日消息,昨日,OpenAI对外公布其首款定制推理芯片Jalapeño的实测性能结果。测试表明,Jalapeño能够在单位功耗下完成更多AI推理任务,同时显著降低请求端到端延迟。对业务侧而言,这意味着随着业务需求扩张,用户可以获得更快响应速度、更高服务吞吐以及更稳定的访问体验。

Jalapeño的性能在GPT‑OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T三款模型上均得到验证,证明该架构既可以适配OpenAI自研模型,也能够支持外部开源大模型。在三款模型的测试条件下,峰值吞吐量场景下,Jalapeño每瓦可完成的AI任务量达到参考商用推理系统的1.5‑1.9倍,端到端延迟可缩减41%‑72%;针对高交互类工作负载,性能提升可达2.1‑4.1倍。

OpenAI自身大模型技术深度参与了Jalapeño的全流程研发。早期AI模型辅助团队完成芯片方案探索与设计验证,团队仅用时9个月便完成从初步架构设计到芯片流片的完整流程;新一代模型则进一步加速芯片的性能调优与软件编程工作。

一、单芯片架构设计:平衡推理速度与能效

Jalapeño的设计面向下一代大语言模型,尤其聚焦智能体高交互推理场景,核心目标是AI交互中高吞吐量与低延迟难以兼顾的行业痛点。

大模型推理分为两个核心阶段,预填充(Prefill)和解码(Decode),二者的性能瓶颈存在明显差异。预填充阶段负责处理用户输入提示词,属于算力密集型计算阶段;解码阶段则由模型逐Token生成回复,性能瓶颈主要来自内存带宽。推理运行过程中,数据在计算核心与存储单元之间的搬运会产生通信延迟,造成计算单元等待,通信开销甚至会抵消计算带来的性能收益。

推理运行过程中,数据在计算核心与存储单元之间的搬运会产生通信延迟,造成计算单元等待,通信开销甚至会抵消计算带来的性能收益。

Jalapeño的核心设计思路是最大限度削减数据搬运与通信延迟。该芯片支持将模型状态(包含生成回复必需的KV缓存)显式固定在本地存储;系统可以针对每一个推理阶段,动态调配算力、内存、网络资源组合。

网络是这套架构不可分割的组成部分。通过这套互联网络设计,全部计算任务可以在一套相互连通的硬件系统内完成,尽可能减少跨设备的数据搬运,保障每一条推理请求从接收至处理完毕,全程保持高速高效。

这套架构最终实现了一套均衡、高可适配的推理加速器:既能够适配不断迭代的各类模型架构,在预填充、解码两个阶段均具备优异性能,也可适配智能体场景下预填充与解码负载占比动态变化的工作负载。

二、用AI设计芯片,芯片也面向AI编程

AI深度介入Jalapeño的研发全过程。借助AI工具探索多样化实现方案,压缩设计‑测试‑验证迭代周期,并基于真实模型负载持续优化。AI同时参与芯片算术运算电路优化,帮助团队按期在芯片内集成更多计算算力。

Jalapeño的编程接口简洁、行为具备可预测性,同时适配人类工程师与AI程序。工程师可通过本地张量、显式通信、确定性同步完成计算任务描述;AI则负责完成任务在整套硬件系统上的映射、数据放置、资源调度与多组件协同。这套确定性的架构抽象,让AI得以攻克传统并行编程的复杂难题。

即便硬件架构具备灵活性,适配全新模型依旧需要开发对应内核和完成模型专属优化。OpenAI借助Codex搭配GPT‑Astra,仅用两个月时间,就让三款原本不在Jalapeño初始量产规划内的开源权重模型(GPT‑OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T)实现高性能运行。这既体现了硬件架构的灵活度,也印证了AI辅助编程的工程效率。

针对GPT‑OSS的部分注意力模块与混合专家(MoE)模块,AI生成的算子实现代码性能较人类专家手写代码提升1.5‑1.8倍。该结果仅针对选定模块,并非完整模型,但预示了全新的芯片软件迭代范式。

三、基准测试:三款公开模型下性能表现优异

为客观评估Jalapeño的实际推理表现,OpenAI采用SemiAnalysis公开基准测试套件InferenceX,该工具可完整模拟AI请求全流程服务行为,将Jalapeño与英伟达GB200 STP和GB300 STP做横向对比,覆盖高吞吐量批量服务、高交互低延迟等全部典型推理场景。

测试结果显示,在GPT‑OSS‑120B、DeepSeek R1‑670B两款模型测试中,Jalapeño性能曲线处于帕累托最优前沿。

针对GPT‑OSS‑120B模型,对比GB200 STP,Jalapeño的每千瓦混合吞吐在单用户解码速度、端到端请求延迟维度均具备优势;高交互负载下能效优势进一步放大,相近吞吐水平下,端到端延迟可缩减约76%,兼顾整体吞吐量的同时实现更快交互响应。


针对DeepSeek R1‑670B模型,对比GB300 STP,Jalapeño同样在上述两项指标上表现更优;高交互负载下能效优势进一步放大,相近吞吐水平下,端到端延迟可缩减约80%,兼顾整体吞吐量的同时实现更快交互响应。


在与现有最优加速器保持同等最高单用户解码速度的条件下,Jalapeño在GPT‑OSS‑120B、DeepSeek R1、Kimi K2.5三款模型上,每千瓦混合token吞吐分别达到对比方案的53.7倍、104.3倍、56.1倍,高能效优势十分突出。


Jalapeño在GPT‑OSS‑120B、DeepSeek R1‑670B、Kimi K2.5‑1T三款模型上,单用户峰值生成速度分别达到1459、700、694token/s/user,相较现有最优加速器分别提升至2.7倍、4.1倍、3.8倍,在参数量更大的模型场景中,交互响应速度的优势更为突出。


在各平台最优运行条件下,Jalapeño在GPT‑OSS‑120B、DeepSeek R1‑670B、Kimi K2.5‑1T三款模型上,峰值每千瓦混合token吞吐相较现有最优加速器分别提升至1.9倍、1.7倍、1.5倍,展现出全面领先的能效水平。


在三款公开模型的测试范围内,Jalapeño在单位功耗性能与延迟指标上实现更优组合,达到帕累托最优前沿。为保证对比公平,测试按照各加速器官方标称功耗完成归一化处理。Jalapeño标称功耗700瓦,在本次测试负载下,实际持续运行功耗不超过550瓦。

Jalapeño在GPT‑OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T上均展现出优秀性能。在测试规模最大的公开模型Kimi K2.5 1T上,对比参考系统,Jalapeño峰值每瓦性能提升至约1.5倍,端到端延迟缩减约71%。内部测试显示,面对OpenAI自研前沿模型时,Jalapeño的性能优势会进一步放大。这表明,随着模型负载规模扩大、算力需求提升,该架构的价值将更加凸显。

结语:自研芯片重塑AI推理基础设施

AI基础设施的核心价值,是完成现实场景下的有效计算任务。Jalapeño能够在同等功耗与硬件条件下完成更多有效推理计算,承载更大规模业务需求,降低AI服务交付成本。以Jalapeño为代表的自研推理芯片,有望凭借极低的交互响应时延,拓展智能体的落地应用边界。

同时,Jalapeño也展现出全栈协同设计与AI辅助硬件开发的全新范式。从芯片架构、存储网络设计,到算子内核的自动化生成,AI不再仅仅是被芯片运行的业务对象,更深度参与硬件研发与软件适配全流程。这一模式也为行业提供参考:面向智能体时代的推理硬件,需要兼顾硬件架构的确定性与软件层面的AI赋能,才能更好适配模型快速迭代带来的负载变化。未来随着多代芯片平台持续演进,也将进一步推动大模型推理效率与智能体应用的持续突破。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
看完欧豪这一期的《大哥小助理》才发现,普通人吃不了演员这碗饭!

看完欧豪这一期的《大哥小助理》才发现,普通人吃不了演员这碗饭!

草莓解说体育
2026-09-15 08:59:28
开售4天卖了30万台!华为「阔直板」Pura X View爆火,比折叠屏还香?

开售4天卖了30万台!华为「阔直板」Pura X View爆火,比折叠屏还香?

泡泡网
2026-09-14 14:57:07
峰会结束即刻启程离开印度,中国态度,藏着大国大智慧

峰会结束即刻启程离开印度,中国态度,藏着大国大智慧

起喜电影
2026-09-15 07:38:34
人间丨92岁,跳出2.05米的世界冠军,还没打算停下来

人间丨92岁,跳出2.05米的世界冠军,还没打算停下来

大众网
2026-09-14 18:58:16
唐嫣和好友聚餐吃火锅 穿一身芭比粉套装甜而不腻

唐嫣和好友聚餐吃火锅 穿一身芭比粉套装甜而不腻

草莓解说体育
2026-09-14 10:22:45
赵雷鸟巢演唱会情侣求婚被全场喊“坐下”,当事人称已报警要求视频下架

赵雷鸟巢演唱会情侣求婚被全场喊“坐下”,当事人称已报警要求视频下架

韩小娱
2026-09-15 10:57:31
我们需要警惕一种情形:美国AI巨头的“减速论”,可能会对开源模型构成实质性绞杀

我们需要警惕一种情形:美国AI巨头的“减速论”,可能会对开源模型构成实质性绞杀

锦缎研究院
2026-09-15 07:51:51
乒坛要变天?张本美和夺冠不到1天,状态直逼孙颖莎,也让全日心寒

乒坛要变天?张本美和夺冠不到1天,状态直逼孙颖莎,也让全日心寒

秋月寒江
2026-09-14 13:22:02
为什么切尔西明明引进大马丁,但丢球数依旧居高不下

为什么切尔西明明引进大马丁,但丢球数依旧居高不下

大卫的篮球故事
2026-09-14 16:34:33
2027款奥德赛真来了?这回本田终于听进去了

2027款奥德赛真来了?这回本田终于听进去了

侃故事的阿庆
2026-09-14 05:16:15
46年来首次!美地面部队杀入伊朗,339枚导弹狂轰救下两飞行员

46年来首次!美地面部队杀入伊朗,339枚导弹狂轰救下两飞行员

麓谷隐士
2026-09-15 00:05:07
两性心理学:如果一个女人能和一个婚内的男人,保持长久的关系,不是因为两个人之间真有感情,而是因为这个女人太傻

两性心理学:如果一个女人能和一个婚内的男人,保持长久的关系,不是因为两个人之间真有感情,而是因为这个女人太傻

心理观察局
2026-09-15 06:16:05
卷走700多名家长2000万学费,网红“985海归教授”跑路:家长有的交费30多万保研,有的花1万多“预购”2031年高考服务

卷走700多名家长2000万学费,网红“985海归教授”跑路:家长有的交费30多万保研,有的花1万多“预购”2031年高考服务

汉史趣闻
2026-09-15 09:27:12
国乒兵分两路!王艺迪领衔再战WTT赛,莎头、曼昱等人出征亚运会

国乒兵分两路!王艺迪领衔再战WTT赛,莎头、曼昱等人出征亚运会

全言作品
2026-09-14 11:58:14
全世界都被普京骗了?打乌克兰只是幌子,真正目标其实已悄悄布局四年

全世界都被普京骗了?打乌克兰只是幌子,真正目标其实已悄悄布局四年

扶苏聊历史
2026-08-27 16:15:02
她是敬一丹母亲,公安干部曾任副处长,去世7年,留下1700封家书

她是敬一丹母亲,公安干部曾任副处长,去世7年,留下1700封家书

寒士之言本尊
2026-09-14 14:29:19
贵州旅游,女邻居非要蹭我车,途中共处一室,回来后她提了个要求

贵州旅游,女邻居非要蹭我车,途中共处一室,回来后她提了个要求

人间百态大全
2026-09-15 06:40:03
他曾杀害数千红军及军长,故居却一度成景区被洗白,如今终于被摘牌

他曾杀害数千红军及军长,故居却一度成景区被洗白,如今终于被摘牌

史不语
2026-09-13 13:00:03
亚朵内部称谓引发争议,网友称官瘾有点大,公司上半年猛赚10个亿

亚朵内部称谓引发争议,网友称官瘾有点大,公司上半年猛赚10个亿

财天COVER
2026-09-14 15:01:34
随着卫冕冠军1-1,吉达联合1-1,萨德0-3,亚冠精英赛最新积分榜出炉

随着卫冕冠军1-1,吉达联合1-1,萨德0-3,亚冠精英赛最新积分榜出炉

侧身凌空斩
2026-09-15 04:17:51
2026-09-15 11:36:49
芯东西 incentive-icons
芯东西
智东西AI媒体矩阵品牌。芯东西,芯片产业新媒体。我们是一群追芯人,专注报道AI芯片和半导体产业创新。
2595文章数 8160关注度
往期回顾 全部

科技要闻

芯片产业链蒸发超5000亿美元,特朗普大怒

头条要闻

"卖发动机的Tina"让外国人疯狂 "抽象"视频火遍TikTok

头条要闻

"卖发动机的Tina"让外国人疯狂 "抽象"视频火遍TikTok

体育要闻

英格兰业余门将,拒绝去非洲当国王

娱乐要闻

她是敬一丹女儿,把公益当事业

财经要闻

未来五年,电子信息制造业发展规划出炉

汽车要闻

纯电续航960km/迪迪虾上车 腾势N8L纯电售29.98万元起

态度原创

家居
本地
健康
公开课
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

耳石症vs颈椎病,头晕的原因差太多

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

24小时内58次空袭 也门冲突快速升级

无障碍浏览 进入关怀版