
OpenAI 与博通联合自研的推理芯片 Jalapeño 在测试中展现出每瓦性能比英伟达 GB200 高 1.5-1.9 倍,功耗仅为其一半,且从设计到流片仅用 9 个月,标志着 AI 公司自研芯片进入实质性阶段。
过去几年,AI 行业的算力命脉几乎被英伟达一家牢牢掌握。然而,随着模型规模与推理需求的指数级增长,单纯依赖通用 GPU 的路线正面临成本与效率的双重瓶颈。OpenAI 与博通合作推出的首款自研推理芯片 Jalapeño,在近期公布的基准测试中展现出惊人的能效比与低延迟表现,标志着 AI 公司从“租用算力”向“自造算力”的关键转折。
Jalapeño 的测试成绩确实亮眼。根据 SemiAnalysis 发布的 InferenceX 基准测试,在运行 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 这三款主流大模型时,Jalapeño 的每瓦性能是英伟达 GB200/GB300 的 1.5 至 1.9 倍,端到端延迟则缩短至对照系统的 30% 至 60%。具体到 DeepSeek R1 的推理任务,一次 8K 输入、1K 输出的请求从 5.99 秒降至 1.65 秒,最低 token 间隔也从 5.90ms 压缩到 1.43ms。
这些数字背后,是芯片设计理念的根本差异。Jalapeño 并非通用 GPU,而是从零开始为“推理”这一特定工作负载而生的专用加速器(ASIC)。其设计核心在于解决当前 AI 推理中普遍存在的“内存墙”问题——计算单元的速度远超数据搬运速度,导致大量算力在等待数据中浪费。为了突破这一瓶颈,OpenAI 将计算核心、HBM 内存和网络通信纳入统一协同设计,而非像传统 GPU 那样将各部分模块化拼接。
Jalapeño 配备了 216GiB 的 HBM4 内存,带宽高达 15.4TB/s,接近微软 Maia 200 和 Google Ironwood 的两倍。更激进的是,它将计算核心与内存划分为多个对应区域,让模型权重和 KV Cache 尽量在本地内存中完成读写,仅在必要时才通过高速网络跨区域同步,从而大幅减少了数据在芯片内部的搬运次数。这种“以数据为中心”的架构,使得其持续功耗低于 550W,仅为英伟达 GB200(1200W)和 GB300(1400W)的一半不到,却实现了更高的推理吞吐。
传统上,一颗高复杂度 AI 加速芯片从设计到流片需要 18 至 24 个月。而 OpenAI 的 Jalapeño 项目,从 2025 年 2 月正式进入设计周期,到 11 月完成流片,仅用了 9 个月;随后 6 个月拿到成品芯片,再经过约 3 个月的调试,于今年 8 月开启公开测试。这一速度几乎逼近半导体工程的物理极限。
这一“闪电速度”背后,是 OpenAI 多年的人才与技术积累。早在 2023 年,OpenAI 便邀请前 Google TPU 负责人 Richard Ho 组建硬件团队,初始成员多来自 Google TPU 项目,自带丰富的专用芯片设计经验。此外,与博通的深度合作也提供了关键的制造与 IP 支持。OpenAI 在 2025 年 10 月宣布与博通合作部署 10 吉瓦定制 AI 加速器,让“前沿模型与产品研发经验直接融入硬件”,随后一个月便正式流片。
这种速度也反映了 AI 公司对算力自主的迫切性。随着 ChatGPT 等产品向 Agent 化演进,推理调用次数从几次飙升至几十次,延迟累积成为体验瓶颈。Jalapeño 的低延迟特性,有望让复杂的 Agent 任务响应接近普通聊天,甚至未来 ChatGPT 可能不再需要区分“聊天”与“工作”模式,只需一个对话框即可。
在数据中心运营中,电费是最大的可变成本之一。Jalapeño 以不到英伟达一半的功耗提供更高的推理性能,意味着 OpenAI 在同等算力需求下可大幅削减电力支出。考虑到 AI 模型训练与推理的能耗正以指数级增长,这种能效优势将转化为长期的经济壁垒。
OpenAI 计划在年底前将 Jalapeño 部署到其计算基础设施中,同时第二代产品已处于开发中段,第三代也初具雏形。这表明造芯并非一次性尝试,而是 OpenAI 长期战略的核心部分。
OpenAI 的 Jalapeño 并非孤例。国内科技巨头同样在加速布局自研 AI 芯片。百度早在 2018 年就推出了昆仑芯片,目前昆仑芯 3 代已支持文心大模型的推理优化;阿里巴巴的平头哥半导体推出了含光系列,用于其云服务中的 AI 推理;华为的昇腾芯片更是与昇思框架深度绑定,支撑了盘古大模型等自有生态。此外,字节跳动也启动了自研芯片项目,预计将用于其豆包大模型的推理加速。
相较之下,国内厂商在芯片设计上更注重与自身软件栈的协同,而非单纯追求峰值性能。例如,华为昇腾通过“达芬奇”架构将 AI 算子与编译器深度优化,在特定模型上能效比亦不输国际竞品。不过,在 HBM 内存与先进制程方面,国内仍面临一定供应链挑战。但整体来看,自研芯片已成为 AI 公司的共识,这将推动整个行业从“买算力”转向“造算力”,重塑全球 AI 基础设施的竞争格局。
Jalapeño 的出现,可能预示着 AI 芯片市场将从英伟达一家独大转向多元化竞争。正如当年 Android 系统的开源推动了智能手机的百花齐放,如今 OpenAI 等公司自研芯片,或许会催生更多针对特定工作负载的专用加速器,从而降低整体算力成本,加速 AI 应用创新。
当然,自研芯片并非坦途。除了巨额研发投入,还面临制程工艺、EDA 工具、生态兼容等挑战。OpenAI 能否持续迭代并大规模部署,仍需时间检验。但至少,它已经证明:AI 公司不必永远受制于芯片供应商。
Jalapeño 是专为 AI 推理设计的 ASIC 芯片,而英伟达 GPU 是通用计算芯片。Jalapeño 在推理任务上的能效比和延迟表现优于 GB200/GB300,但无法像 GPU 那样灵活支持各种计算任务。
OpenAI 计划在 2026 年底前将 Jalapeño 部署到其计算基础设施中,但具体商用时间取决于后续测试与部署进度。
自研芯片有助于 OpenAI 降低算力成本、提升推理效率,并增强对算力供应链的掌控力,是其长期战略的重要一环。
国内多家公司已布局自研 AI 芯片,如百度的昆仑、华为的昇腾、阿里的含光等,各有侧重,但整体在先进制程与生态上仍面临挑战。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

DeepMind 的 Agent 实验揭示了一个尴尬现实:当数学难题变成跑分工具,AI 大厂竞相宣布「攻克名题」的背后,数学本身得到了什么?

Anthropic、OpenAI、Google DeepMind 与 xAI 罕见地在「放缓大模型发展」上达成公开共识。但细读事故报告会发现,被包装成「力量失控」的事件,更像是一次训练流程缺陷。本文拆解安全叙事与 IPO 竞争逻辑之间的张力。

25位菲尔兹奖得主联合发声,矛头指向AI企业把解题当基准的做法。从88小时速通纳维-斯托克斯方程到优先权争议,这场冲突揭示的是效率逻辑与数学传承之间的深层错位。
最新の SEO・GEO 情報をお届けします。
プライバシーを尊重します。いつでも購読を解除できます。