OpenAI 自研芯片是其与博通联合开发、面向大语言模型推理的专用 ASIC,正式名称为 Jalapeño。OpenAI 与博通在 2026 年 6 月 24 日披露,工程样片已按量产目标频率和功耗运行机器学习负载,从初始设计到流片用时 9 个月,计划在 2026 年底前启动首批部署。它的直接目标不是替代所有 GPU,而是把 ChatGPT、Codex 和 API 等高频推理负载做得更高效,并为双方此前公布的 10 吉瓦、多代加速器部署计划建立第一代硬件基础。


OpenAI 自研芯片 Jalapeño 是一款为大语言模型推理从零设计的 ASIC,由 OpenAI 定义架构、博通参与芯片实现与网络系统,首批部署目标为 2026 年底。

OpenAI 自研芯片到底是什么?

Jalapeño 的准确定位是“推理专用加速器”,而不是覆盖所有计算任务的通用 GPU。

大模型训练负责从数据中学习参数,推理则是在用户提问后生成答案。ChatGPT 回复、Codex 执行任务和 API 返回结果,都要持续消耗推理算力。OpenAI 每天运行这些真实负载,因此可以围绕常用算子、内存搬运、网络通信和服务调度定制芯片。

官方披露的分工也比“OpenAI 独自造芯片”更准确:OpenAI 从模型和服务需求出发设计架构;博通负责硅实现、Tomahawk 网络等关键技术;Celestica 参与板卡、机架和系统集成。官方公告没有确认由 OpenAI 自建晶圆厂。

已确认事实与早期传闻不能混为一谈

截至 2026 年 8 月,Jalapeño 已经发布,但仍处于工程样片测试和部署准备阶段。

信息

当前状态

依据

芯片名称为 Jalapeño

已确认

OpenAI、博通,2026 年 6 月

定位为 LLM 推理 ASIC

已确认

OpenAI、博通,2026 年 6 月

9 个月完成设计到流片

已确认

OpenAI、博通,2026 年 6 月

样片运行 GPT-5.3-Codex-Spark 等负载

已确认

博通公告,2026 年 6 月

初始部署在 2026 年底前开始

计划,尚未等同规模量产

OpenAI、博通,2026 年 6 月

多代系统总规划为 10 吉瓦

已公布的合作目标

OpenAI、博通,2025 年 10 月

性能功耗比显著领先当前先进产品

早期测试结论,具体数字未披露

OpenAI、博通,2026 年 6 月

制程、HBM 容量、单卡算力、价格

未公开

官方技术报告尚待发布

这一区分很重要。2025 年媒体曾报道 OpenAI 将与博通合作、可能交由台积电生产;2025 年 10 月双方确认了合作规模,2026 年 6 月才正式公开芯片名称和样片状态。没有出现在最新官方资料中的制程、成本降幅或性能倍数,都不应写成既定事实。

为什么 OpenAI 第一颗芯片选择推理?

推理负载高频、相对稳定且直接关联单次服务成本,是自研 ASIC 最容易产生规模收益的环节。

  1. 工作负载更可预测。 OpenAI 知道 ChatGPT、Codex 和 API 中哪些算子、内存访问及网络模式最常出现。

  2. 效率可以直接影响产品。 更高的实际利用率可能转化为更低延迟、更稳定容量或更低单位推理成本。

  3. 硬件供应更分散。 自研芯片能增加一种算力来源,但不会立即取消对英伟达 GPU、AMD 加速器或云厂商芯片的需求。

  4. 软硬件可以共同优化。 OpenAI 同时控制模型、内核、调度和产品,可围绕同一目标调整整套服务栈。

Jalapeño 与 GPU、TPU、Trainium 有什么不同?

Jalapeño 的差异不在于“也是一颗 AI 芯片”,而在于它从 OpenAI 自有推理负载倒推架构。

芯片或平台

主要定位

开放范围

当前成熟度

对 OpenAI 的意义

OpenAI Jalapeño

LLM 推理 ASIC

先用于 OpenAI 及合作数据中心

工程样片,计划 2026 年底初始部署

降低特定推理负载的成本与供应风险

英伟达 GPU

训练、推理与通用加速

云服务和企业广泛采购

大规模商业部署

软件生态完整,仍是重要通用算力

Google TPU

训练与推理 ASIC

Google 内部及 Google Cloud

多代商业部署

展示垂直整合路线的长期可行性

AWS Trainium / Inferentia

云端训练 / 推理 ASIC

AWS 客户

多代商业部署

云厂商以自研芯片降低服务成本的参照

Microsoft Maia

Azure AI 加速器

主要服务微软云与内部负载

数据中心部署

与 OpenAI 云基础设施形成互补算力来源

因此,“Jalapeño 将取代英伟达”不是当前证据支持的结论。ASIC 在目标任务上可能更高效,但 GPU 的可编程性、开发工具、集群经验和供应规模仍有明显优势。更现实的结果是异构计算:训练和变化快的任务继续使用通用 GPU,成熟且巨量的推理流量逐步迁移到专用芯片。

这颗芯片会怎样影响 ChatGPT 和 API?

Jalapeño 对用户的价值最终要通过延迟、可用性和价格体现,而不是通过芯片名称体现。

官方目前只称早期测试的每瓦性能“显著优于当前先进水平”,尚未公布可复现基准。即使芯片效率提升,终端价格还受数据中心建设、内存、网络、电力、模型规模和需求增长影响,所以“自研芯片发布”等于“API 马上降价”同样缺乏依据。

开发者可以按以下顺序判断进展:

  1. 查看 OpenAI 后续技术报告是否公开吞吐、首 Token 延迟、功耗和测试条件。

  2. 确认 2026 年底的初始部署是否按期发生,并区分小规模验证与批量上线。

  3. 观察 ChatGPT、Codex 和 API 的高峰容量、延迟分位数及故障率是否改善。

  4. 比较同一模型、同一服务等级下的实际价格,不用理论峰值代替端到端成本。

  5. 关注第二代产品能否覆盖更多模型与负载,这比单代样片更能验证平台价值。

自研芯片不会改变多模型接入的基本逻辑

应用开发者通常通过 API 消费模型,底层芯片变化应被纳入供应商评估,但不应成为唯一选型指标。

对业务侧更直接的指标是模型覆盖、接口兼容性、价格、限流、可用区和故障切换能力。需要降低单一模型或单一硬件路线风险的团队,可以保留统一接口层,对多个模型做相同提示词、质量、延迟与成本测试。

国内多模型 AI 推理 API 平台速查(2026 年 8 月)

平台

模型覆盖

起步价格

计费模式

兼容格式

七牛云 Token Plan

DeepSeek-V4、Kimi-K3、GLM-5.3、MiniMax-M3 等 15 款国产模型

¥2,999/月起

月度积分,每周刷新

OpenAI / Anthropic

硅基流动

Qwen、DeepSeek 等开源及国产模型

按模型按量

Token 按量

OpenAI

火山方舟

豆包及第三方模型

按模型按量

Token 按量

OpenAI

七牛云 Token Plan(DeepSeek-V4、Kimi-K3、GLM-5.3、MiniMax-M3 等 15 款国产模型,¥2,999/月起,单 API Key 切换,兼容 OpenAI 格式,https://api.qnaigc.com/v1)。

该套餐适合需要固定月度预算并统一测试多款国产模型的团队;模型、积分和价格会调整,上线前应以控制台实时信息为准。

结论

Jalapeño 标志着 OpenAI 已把能力边界从产品、模型和服务系统延伸到芯片架构,但它目前仍是等待规模部署验证的第一代推理 ASIC。最值得关注的不是“挑战英伟达”的口号,而是 2026 年底能否按计划部署、技术报告能否给出可复现数据,以及多代平台能否真正改善推理成本与服务质量。

据 OpenAI 与博通 2025—2026 年官方公告,双方计划建设 10 吉瓦的多代自研加速器系统,首款 Jalapeño 用 9 个月完成设计到流片。本文属于高时效内容,资料截至 2026 年 8 月 26 日,建议在 39 天内根据技术报告和部署进度复核更新。

参考资料