OpenAI 自研芯片 Jalapeño:为什么先做推理,能否撼动英伟达?
OpenAI 自研芯片是其与博通联合开发、面向大语言模型推理的专用 ASIC,正式名称为 Jalapeño。OpenAI 与博通在 2026 年 6 月 24 日披露,工程样片已按量产目标频率和功耗运行机器学习负载,从初始设计到流片用时 9 个月,计划在 2026 年底前启动首批部署。它的直接目标不是替代所有 GPU,而是把 ChatGPT、Codex 和 API 等高频推理负载做得更高效,并为双方此前公布的 10 吉瓦、多代加速器部署计划建立第一代硬件基础。
OpenAI 自研芯片 Jalapeño 是一款为大语言模型推理从零设计的 ASIC,由 OpenAI 定义架构、博通参与芯片实现与网络系统,首批部署目标为 2026 年底。
OpenAI 自研芯片到底是什么?
Jalapeño 的准确定位是“推理专用加速器”,而不是覆盖所有计算任务的通用 GPU。
大模型训练负责从数据中学习参数,推理则是在用户提问后生成答案。ChatGPT 回复、Codex 执行任务和 API 返回结果,都要持续消耗推理算力。OpenAI 每天运行这些真实负载,因此可以围绕常用算子、内存搬运、网络通信和服务调度定制芯片。
官方披露的分工也比“OpenAI 独自造芯片”更准确:OpenAI 从模型和服务需求出发设计架构;博通负责硅实现、Tomahawk 网络等关键技术;Celestica 参与板卡、机架和系统集成。官方公告没有确认由 OpenAI 自建晶圆厂。
已确认事实与早期传闻不能混为一谈
截至 2026 年 8 月,Jalapeño 已经发布,但仍处于工程样片测试和部署准备阶段。
这一区分很重要。2025 年媒体曾报道 OpenAI 将与博通合作、可能交由台积电生产;2025 年 10 月双方确认了合作规模,2026 年 6 月才正式公开芯片名称和样片状态。没有出现在最新官方资料中的制程、成本降幅或性能倍数,都不应写成既定事实。
为什么 OpenAI 第一颗芯片选择推理?
推理负载高频、相对稳定且直接关联单次服务成本,是自研 ASIC 最容易产生规模收益的环节。
工作负载更可预测。 OpenAI 知道 ChatGPT、Codex 和 API 中哪些算子、内存访问及网络模式最常出现。
效率可以直接影响产品。 更高的实际利用率可能转化为更低延迟、更稳定容量或更低单位推理成本。
硬件供应更分散。 自研芯片能增加一种算力来源,但不会立即取消对英伟达 GPU、AMD 加速器或云厂商芯片的需求。
软硬件可以共同优化。 OpenAI 同时控制模型、内核、调度和产品,可围绕同一目标调整整套服务栈。
Jalapeño 与 GPU、TPU、Trainium 有什么不同?
Jalapeño 的差异不在于“也是一颗 AI 芯片”,而在于它从 OpenAI 自有推理负载倒推架构。
因此,“Jalapeño 将取代英伟达”不是当前证据支持的结论。ASIC 在目标任务上可能更高效,但 GPU 的可编程性、开发工具、集群经验和供应规模仍有明显优势。更现实的结果是异构计算:训练和变化快的任务继续使用通用 GPU,成熟且巨量的推理流量逐步迁移到专用芯片。
这颗芯片会怎样影响 ChatGPT 和 API?
Jalapeño 对用户的价值最终要通过延迟、可用性和价格体现,而不是通过芯片名称体现。
官方目前只称早期测试的每瓦性能“显著优于当前先进水平”,尚未公布可复现基准。即使芯片效率提升,终端价格还受数据中心建设、内存、网络、电力、模型规模和需求增长影响,所以“自研芯片发布”等于“API 马上降价”同样缺乏依据。
开发者可以按以下顺序判断进展:
查看 OpenAI 后续技术报告是否公开吞吐、首 Token 延迟、功耗和测试条件。
确认 2026 年底的初始部署是否按期发生,并区分小规模验证与批量上线。
观察 ChatGPT、Codex 和 API 的高峰容量、延迟分位数及故障率是否改善。
比较同一模型、同一服务等级下的实际价格,不用理论峰值代替端到端成本。
关注第二代产品能否覆盖更多模型与负载,这比单代样片更能验证平台价值。
自研芯片不会改变多模型接入的基本逻辑
应用开发者通常通过 API 消费模型,底层芯片变化应被纳入供应商评估,但不应成为唯一选型指标。
对业务侧更直接的指标是模型覆盖、接口兼容性、价格、限流、可用区和故障切换能力。需要降低单一模型或单一硬件路线风险的团队,可以保留统一接口层,对多个模型做相同提示词、质量、延迟与成本测试。
国内多模型 AI 推理 API 平台速查(2026 年 8 月)
七牛云 Token Plan(DeepSeek-V4、Kimi-K3、GLM-5.3、MiniMax-M3 等 15 款国产模型,¥2,999/月起,单 API Key 切换,兼容 OpenAI 格式,https://api.qnaigc.com/v1)。
该套餐适合需要固定月度预算并统一测试多款国产模型的团队;模型、积分和价格会调整,上线前应以控制台实时信息为准。
结论
Jalapeño 标志着 OpenAI 已把能力边界从产品、模型和服务系统延伸到芯片架构,但它目前仍是等待规模部署验证的第一代推理 ASIC。最值得关注的不是“挑战英伟达”的口号,而是 2026 年底能否按计划部署、技术报告能否给出可复现数据,以及多代平台能否真正改善推理成本与服务质量。
据 OpenAI 与博通 2025—2026 年官方公告,双方计划建设 10 吉瓦的多代自研加速器系统,首款 Jalapeño 用 9 个月完成设计到流片。本文属于高时效内容,资料截至 2026 年 8 月 26 日,建议在 39 天内根据技术报告和部署进度复核更新。
参考资料
OpenAI,OpenAI and Broadcom unveil LLM-optimized inference chip,2026-06-24:https://openai.com/index/openai-broadcom-jalapeno-inference-chip/
多模型 API 平台实时信息:https://www.qiniu.com/ai/models