网易首页 > 网易号 > 正文 申请入驻

OpenAI首颗芯片,吊打英伟达

0
分享至

公众号记得加星标⭐️,第一时间看推送不会错过。

OpenAI表示,其新款 Jalapeno 芯片在测试中表现优于英伟达公司目前的芯片产品线,凸显了该公司在自主研发 AI 处理器方面取得的进展。

在测试中,Jalapeno处理器在两项指标上领先:单位功耗下可处理的AI工作量以及响应速度。OpenAI芯片负责人Richard Ho周一在接受采访时表示,该半导体芯片的竞争对手是英伟达的GB300,后者是此次测试所用公开基准测试系统中的领先者。

ChatGPT 的开发商计划于今年晚些时候开始使用新型芯片来支持其人工智能模型,这是其构建自有人工智能基础设施的整体战略的一部分。该公司加入了众多致力于开发自主人工智能芯片的公司行列——目前该领域由英伟达主导。

Ho周二在彭博科技节目中表示,随着新芯片的广泛应用,OpenAI 的成本将大幅降低。“这是一款非常优秀的芯片——它应该能大幅降低成本,”他说道。他还表示,只要 OpenAI 能够提高 Jalapeno 芯片的产量,并且成本节约能够达到预期水平,公司就计划使用自主研发的芯片处理更多的人工智能任务。

OpenAI与博通公司合作开发了Jalapeno处理器。博通公司为众多客户定制芯片。两家公司去年宣布了合作协议,并在今年6月盛赞该处理器的开发速度,称其以创纪录的速度完成。

Ho表示,通常情况下,有些芯片更擅长运行人工智能任务,有些则更擅长快速响应,但Jalapeno芯片兼具两者优势。他还说,OpenAI将决定哪些人工智能模型可以在Jalapeno芯片上运行,客户可以根据自身需求选择更经济实惠或性能更优的方案。

“在实验室里,Jalapeno 在高吞吐量领域和低延迟领域都表现出色。高吞吐量意味着它能够以更低的成本服务更多客户,而低延迟意味着对于那些关心延迟的客户来说,响应时间将非常非常快,”Ho 说。

Jalapeno表示,由于该芯片在低电压(700瓦)下取得了强劲的性能,因此可以帮助OpenAI在运行其数据中心时节省资金,而电力是数据中心的一项关键成本。

Jalapeno并未针对刚刚开始出货的新一代英伟达芯片Vera Rubin进行测试。它也并非为训练AI模型而设计,而这正是英伟达技术的强项。Jalapeno的目标应用是AI的推理阶段——即模型已经训练完成,可以开始响应指令并处理任务的阶段。

Jalapeno芯片的速度优势如此显著,以至于OpenAI能够取得以往只有采用不同类型内存和设计的芯片才能实现的成果。例如,OpenAI目前在其部分模型中依赖于Cerebras Systems公司的技术。但Ho表示,这类芯片最适合小型模型。

相比之下,Jalapeno 可以处理更大的目标,他说道。不过,Ho 也表示,OpenAI 的技术短期内不会取代 Cerebras 等供应商。

他说:“我们对计算能力的需求非常大,所以我们才和这么多不同的服务提供商签约。这种情况还会持续一段时间。”

其他初创公司也在研究类似的想法。上周宣布融资后估值达到210亿美元的Etched公司,已经开始出货一款低电压芯片。而由两位谷歌芯片业务前员工创立的MatX公司,正在研发一种旨在同时实现高吞吐量和低延迟的半导体。

OpenAI 公开测试了其新款芯片,测试工具包括其一款较小的开源模型,以及来自 DeepSeek 和 Moonshot AI 的第三方模型。Jalapeno 芯片在 Moonshot 的 Kimi 模型上展现出更显著的优势,Kimi 模型是 OpenAI 测试过的最大模型。在内部测试中,该芯片在运行 OpenAI 一些尚未发布的大型高级模型时也表现出色。该公司在一篇博客文章中表示,这表明该芯片的设计“随着工作负载规模的扩大和要求的提高而变得更有价值”。

OpenAI表示,他们利用自主研发的AI模型加快了芯片的开发速度。第二版芯片的开发工作已接近尾声。Ho表示,公司预计将在“未来几个月”内完成芯片流片——这是设计的最后阶段。

OpenAI 已经在着手设计第三代人工智能技术,该公司希望降低其在全球范围内建设的庞大人工智能基础设施的成本。“我们现在的成本和性能水平已经达到了可以降低基础设施成本的程度,”何先生说。“这是第一步。”

尽管 OpenAI 大力宣传自身成果并将其与英伟达进行比较,但 Ho 仍特意指出,OpenAI 仍然视英伟达为重要的芯片供应商。“英伟达是一个非常好的合作伙伴,我们仍然非常需要英伟达的产品,”他说道。

Jalapeño测试结果,业界领先

自发布 OpenAI 首款定制推理芯片 Jalapeño 以来,我们一直在测试该芯片及其构建的系统。测试结果显示,性能显著提升:Jalapeño 能够在单位功耗下处理更多 AI 任务,同时还能更快地返回响应。Jalapeño 采用单一架构即可实现更高的吞吐量和更低的延迟,而现有硬件系统通常需要在两者之间做出权衡。

对客户而言,这意味着随着需求的增长,他们将获得更快的响应速度、更高效的客服人员以及更可靠的访问。我们的使命是确保通用人工智能造福全人类。这些成果将有助于降低人工智能的性能,使其更加经济实惠,并得到更广泛的应用。

OpenAI 模型也加速了 Jalapeño 的开发。早期的模型帮助团队设计并完成了芯片的开发,而最新的模型则加速了我们对芯片的优化和编程。Jalapeño 的性能在 GPT-OSS 120B、DeepSeek R1 和 Kimi K2.5 1T 上均有体现,表明该架构适用于 OpenAI 内外开发的模型。在这三个平台上,Jalapeño 在峰值吞吐量下每瓦的 AI 工作量是对比系统的 1.5 到 1.9 倍,端到端延迟降低了 1.7 到 3.6 倍。对于高交互性工作负载,其性能更是提升了 2.1 到 4.1 倍。

Jalapeño 也体现了我们更广泛的全栈优势。OpenAI 能够将模型、产品、服务软件、芯片、内存、网络和系统整合在一起,并利用我们从实际工作负载中获得的经验来改进堆栈的每一层。Jalapeño 正在使用第一方芯片进行测试,并取得了可衡量的成果,它标志着一个多代平台的开端。在接下来的几个月里,我们将加速 Jalapeño 的部署,为客户提供速度更快、功能更强大、效率更高的产品。

我们以匹配的用户体验来评估性能,衡量每个系统在满足客户和交互式代理所需的延迟的前提下,单位功耗下能够完成多少有用的AI工作。这一点对于需要按顺序完成多个步骤的代理尤为重要,因为延迟会在整个任务过程中累积。

为了解 Jalapeño 的实际性能,我们使用 SemiAnalysis 的公开基准测试工具 InferenceX 对其进行了测试。InferenceX 能够衡量 AI 请求的完整处理过程。我们将 Jalapeño 与市面上领先的 AI 系统在测试范围内进行了比较,测试范围涵盖了从高吞吐量服务到高交互性、低延迟的应用场景。结果表明,Jalapeño 在吞吐量、能效和延迟方面均表现更佳。虽然有时会以芯片性能作为衡量标准,但我们认为单位功耗性能才是更实用的标准。

Mixed-token 吞吐量与现有加速器的最快解码速度相匹配




在所有三个公开测试模型中,Jalapeño 在测试的运行范围内均实现了更高的每瓦性能和更低的延迟,处于帕累托前沿。为了确保系统间比较的一致性,我们使用每个加速器的芯片额定功率对结果进行了标准化处理。Jalapeño 的额定功率为 700 瓦,但在测试的工作负载下,其持续功耗始终保持在 550 瓦或以下。

Jalapeño 在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上均表现出色。在我们测试过的最大公开模型 Kimi 上,其每瓦峰值性能比对比系统高出约 1.5 倍,端到端延迟降低了约 3.4 倍。在我们的内部测试中,Jalapeño 在 OpenAI 的前沿模型上的优势进一步扩大,这表明随着工作负载规模的扩大和要求的提高,该架构的价值也日益凸显。

Jalapeño 从设计之初就围绕着一个核心问题展开:如果硬件的主要任务是服务于现代和未来的语言模型,尤其是交互式代理,那么我们应该构建什么样的硬件?Jalapeño 的优势在于,它围绕着真实的语言模型工作负载,将芯片、内存、网络、软件和机架级系统进行一体化设计。语言模型推理会经历几个不同的阶段,每个阶段都有不同的瓶颈。预填充阶段(系统处理提示信息)计算量巨大,而解码阶段(系统逐个生成响应词元)则更多地受限于内存带宽。通信也会增加延迟,因为数据必须在内核和芯片之间传输,导致一些处理单元在等待期间处于空闲状态。一个在某个阶段表现优异的系统,在等待数据或在不同资源之间传输模型状态时,可能会失去这种优势。

我们设计 Jalapeño 的目的是最大限度地减少数据移动和通信延迟。这意味着模型状态(包括生成响应时使用的键值缓存)可以显式地放置并保存在本地,而系统则针对每个推理阶段激活合适的计算、内存和网络组合。网络是架构不可或缺的一部分。其庞大的域允许整个工作负载保持在一个连接的系统内,从而最大限度地减少数据移动,并确保整个请求从始至终保持快速高效。最终,我们得到了一个平衡且灵活的加速器,它能够支持不断变化的模型架构,在预填充和解码方面都表现出色,并能随着两者之间平衡的变化而进行调整,这是智能体工作负载的一个显著特征。

人工智能在Jalapeño芯片的开发过程中发挥了直接作用,通过探索各种实现方案、缩短设计、测量和验证周期,以及不断迭代模型工作负载,帮助团队在短短九个月内完成了从初始设计到流片的整个过程。人工智能还帮助优化了芯片的算术电路,使团队能够按计划在芯片中集成更多计算性能。

Jalapeño 的设计目标是为人类和人工智能提供一个清晰、可预测的编程目标。工程师可以通过局部张量、显式通信和可预测的同步来描述工作。人工智能随后可以优化这些工作在系统中的映射、放置、调度和协调方式。这种清晰、可预测的结构为人工智能提供了一种可行的方法来解决传统上棘手的并行编程问题。

支持每个新的模型系列仍然需要新的内核和模型特定的优化。利用 Codex 和 GPT-Astra,团队在两个月内将三个原本不在 Jalapeño 最初生产计划中的开源权重模型实现了高性能运行。这既展现了架构的灵活性,也体现了人工智能在编程方面的强大能力。对于选定的 GPT-OSS 注意力机制和混合专家模型模块,人工智能生成的实现比现有的人工专家编写的实现快 1.5 到 1.8 倍。这些数据适用于选定的模块,而非整个模型,但它们表明了一种强大的全新开发循环。

人工智能基础设施的价值在于它能够支持现实世界中的诸多实用工作。Jalapeño 能够利用相同的算力和硬件产出更多有用的成果,从而帮助我们满足更多需求,并降低交付成功成果的成本。对于 OpenAI 而言,这可以提高运营效率,使有用成果和收入的增长速度超过服务成本的增长速度。它还能支持更广泛的应用,并促使人们持续投资于更优秀的模型、产品和基础设施。更快的推理速度可以带来更快的迭代速度和新的应用场景。

Jalapeño 扩展了高效、低延迟推理的可能性:

1、超快速模式推理,其效率此前仅在快速模式下才能达到。

2、快速模式推理的效率达到了以往只有在批处理模式下才能实现的水平

3、批量模式推理效率更高

我们计划在年底前开始在 OpenAI 的计算基础设施中部署 Jalapeño。这是多代路线图的第一代:第二代正在紧锣密鼓地开发中,第三代也正在成型。每一代都将在我们积累的经验基础上,进一步提升效率和速度。

为满足日益增长的人工智能需求,我们需要利用一切可用资源来提升计算能力。我们将继续广泛部署英伟达及其他合作伙伴的加速器,用于训练和推理工作负载。我们的使命是确保通用人工智能造福全人类。

在部署准备阶段,我们正在持续进行生产环境验证,完善软件,为大规模运行 Jalapeño 做好准备,并验证其在更多模型上的性能。目前为止的成果表明,当我们共同设计整个系统时,能够实现怎样的成果:更高效地为更多用户提供响应更迅速、功能更强大、更具智能性的 AI 服务。

(来源:内容来自半导体行业观察综合)

*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。

今天是《半导体行业观察》为您分享的第4510期内容,欢迎关注。

加星标⭐️第一时间看推送~

求推荐

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
韩方拒换涉台标牌,中方开幕前断然撤展,想凭道歉了事已不可能了

韩方拒换涉台标牌,中方开幕前断然撤展,想凭道歉了事已不可能了

军情观察家
2026-09-03 18:21:54
恒大供应商“伤亡名单”

恒大供应商“伤亡名单”

地产微资讯
2026-09-02 14:36:33
郑钦文:以前我都在大球场作战 现在只能在小球场 要赢回失去的一切

郑钦文:以前我都在大球场作战 现在只能在小球场 要赢回失去的一切

风过乡
2026-09-04 09:55:44
彻底劝退普通人!iPhone 18 Pro Max看着无敌,其实只适合2类人

彻底劝退普通人!iPhone 18 Pro Max看着无敌,其实只适合2类人

时尚的弄潮
2026-09-04 10:14:41
击中了!伊朗早就该这么打了。9月2日凌晨,伊朗革命卫队将报复行动升级为多国同步打击,导弹和无人机齐发

击中了!伊朗早就该这么打了。9月2日凌晨,伊朗革命卫队将报复行动升级为多国同步打击,导弹和无人机齐发

扶苏聊历史
2026-09-03 13:38:29
蔡司高管:中国15年内会造出EUV光刻机!但制裁会把他们逼成“技术疯子”

蔡司高管:中国15年内会造出EUV光刻机!但制裁会把他们逼成“技术疯子”

快科技
2026-09-03 12:10:06
武汉大学女教授与导师不伦之恋的瓜

武汉大学女教授与导师不伦之恋的瓜

笔杆论道
2026-09-04 09:17:32
29.99万!小米新车官宣:9月7日,正式上市!

29.99万!小米新车官宣:9月7日,正式上市!

科技堡垒
2026-09-02 15:44:55
17年来首次!莱巴金娜晋级美网第3轮,前10号种子均闯入32强

17年来首次!莱巴金娜晋级美网第3轮,前10号种子均闯入32强

全景体育V
2026-09-04 12:07:31
王宝强冯清同居八年未领证!女方腹部微隆引猜测,真相令人泪目

王宝强冯清同居八年未领证!女方腹部微隆引猜测,真相令人泪目

做一个合格的吃瓜群众
2026-09-04 09:11:50
曼联4000万飞翼继续缺席训练,已无缘战埃弗顿!卡里克首发或不变

曼联4000万飞翼继续缺席训练,已无缘战埃弗顿!卡里克首发或不变

罗米的曼联博客
2026-09-04 11:41:35
真爷们!张继科罕见回应景甜风波,一句话护尽前任体面,格局大了

真爷们!张继科罕见回应景甜风波,一句话护尽前任体面,格局大了

一盅情怀
2026-09-03 11:22:44
当年我娶了厂长怀孕的女助理,全车间都看我笑话。几个月后孩子出生,妻子递给我一张单子,我看了一眼,直接瘫坐在地

当年我娶了厂长怀孕的女助理,全车间都看我笑话。几个月后孩子出生,妻子递给我一张单子,我看了一眼,直接瘫坐在地

墨染尘香
2026-09-03 11:17:23
尘埃落定!“婚外胚胎案”的朱女士输了!9月1日晚,朱女士哭着称“我错了”

尘埃落定!“婚外胚胎案”的朱女士输了!9月1日晚,朱女士哭着称“我错了”

原广工业
2026-09-04 10:04:38
二十四五岁 他们顶天立地——新华社记者对话武警首批救援官兵

二十四五岁 他们顶天立地——新华社记者对话武警首批救援官兵

新华社
2026-09-03 21:27:54
以色列防长:加沙70%已成废墟,以色列摧毁了地面上的所有房屋;加沙曾存在规模惊人的隧道网络,日夜运作,但“以前没人知道它的存在”

以色列防长:加沙70%已成废墟,以色列摧毁了地面上的所有房屋;加沙曾存在规模惊人的隧道网络,日夜运作,但“以前没人知道它的存在”

鲁中晨报
2026-09-03 12:58:02
亲子心理学:当孩子不尊重你,最好的处理方式,不是接纳,不是共情,而是“情绪断供”!越不惯着,孩子越感恩自律

亲子心理学:当孩子不尊重你,最好的处理方式,不是接纳,不是共情,而是“情绪断供”!越不惯着,孩子越感恩自律

心理观察局
2026-09-04 06:43:03
虚空问责的星宇股份,突然冒出了个帮凶

虚空问责的星宇股份,突然冒出了个帮凶

人格志
2026-09-03 17:40:50
广州三个小孩凑10.5元挽留的便利店正式闭店,老板最新回应:剩余部分货物已打包免费送人,将回家休养一段时间

广州三个小孩凑10.5元挽留的便利店正式闭店,老板最新回应:剩余部分货物已打包免费送人,将回家休养一段时间

上观新闻
2026-09-04 06:31:26
海航双胞胎姐妹花空姐,同时怀孕了

海航双胞胎姐妹花空姐,同时怀孕了

微微热评
2026-09-03 12:18:33
2026-09-04 13:20:49
半导体行业观察
半导体行业观察
专注观察全球半导体行业资讯
14663文章数 35024关注度
往期回顾 全部

科技要闻

OpenAI深夜王炸!GPT-6 Astra来了

头条要闻

梦碎的王子六年后“羞辱”回归 国王表态

头条要闻

梦碎的王子六年后“羞辱”回归 国王表态

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

王宝强冯清八年未领证!真相令人泪目

财经要闻

GPT-6 Astra上线,AGI时代真到来了吗?

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

艺术
健康
房产
家居
时尚

艺术要闻

中国最美的殡仪馆

脑梗能否取栓,关键看这几点!

房产要闻

交付倒计时!超级地中海·憘悦,给海南顶豪打了个样!

家居要闻

2026建博会(广州) 公装联探展交流活动

这么多年,美容觉白睡了?

无障碍浏览 进入关怀版