效率提升22倍:OpenAI首款自主研发的AI芯片性能远超英伟达。
节能高效,性能翻倍:OpenAI 的新型 AI 芯片对行业意味着什么
AI 打造 AI 芯片:OpenAI 的“Jalapeño”芯片以创纪录的速度超越竞争对手
一款芯片彻底颠覆了价值数十亿美元的人工智能市场格局:OpenAI 以创纪录的速度开发了其首款自主研发的 AI 加速器“Jalapeño”,并向其迄今为止最重要的硬件合作伙伴英伟达发起了挑战。初步的独立测试表明,这款新芯片拥有令人印象深刻的能效,在某些方面显著优于英伟达目前的 Blackwell 系列产品。这项研发的真正天才之处在于:OpenAI 利用其先进的 AI 模型大幅加速了芯片设计。这一战略举措对本已捉襟见肘的数据中心电力供应、ChatGPT 的运营成本以及英伟达的市场力量意味着什么?详细分析揭示了 OpenAI 的硬件首秀远不止是一次技术升级——它可能会从根本上改变整个行业的收入模式。.
从客户到竞争对手:OpenAI 用其神奇芯片向英伟达发起挑战
在不到一年半的时间里,OpenAI 开发出了自己的 AI 芯片。初步的独立测试表明,该芯片的效率显著高于英伟达目前的参考硬件。这令人瞩目,因为 OpenAI 此前是英伟达最大的单一客户之一,如今却进入了一个几乎完全由单一厂商垄断的领域。该公司于 2026 年 6 月发布了其首款自主研发的 AI 加速器,代号为 Jalapeño。如今,由独立分析公司 SemiAnalysis 收集的可靠性能数据已经公布。数据显示,OpenAI 在半导体专家博通的积极支持下,从零开始开发出了一款高性能 AI 芯片,该芯片在某些指标上显著优于英伟达目前的 Blackwell 系列芯片,并且似乎也具备与即将推出的 Rubin 平台抗衡的实力。.
这一进展的经济影响不容低估,因为它触及了整个人工智能行业的核心成本问题之一:计算基础设施支出与人工智能服务所能产生的收入之间存在巨大差距。据报道,OpenAI 每季度支出约 37 亿美元,其中推理成本(即在日常运营中持续部署预训练模型的成本)是最大的单项支出。一款能够显著降低这些成本的芯片,不仅改变了一项技术指标,更改变了这家拥有超过 4 亿活跃用户的 ChatGPT 运营公司的整个收入模式。.
一个不受自由约束的独立测试台
这些测试使用了SemiAnalysis公司自主研发的测试平台InferenceX。然而,据SemiAnalysis公司称,分析师本人并未被允许执行这些测试,也未测试所有场景,更未使用信息量更大的测试平台AgentX。这一限制具有重要的经济意义,因为这意味着,尽管可用数据来自一家信誉卓著的芯片分析公司,但这些数据是在OpenAI控制的框架内收集的。任何希望基于此类数据做出合理投资决策的人都应该考虑这一背景,即使结果的总体方向看起来合情合理。.
InferenceX 使用了 OpenWeights 模型 GPT-OSS、DeepSeek R1 和 Kimi K2.5,这表明 Jalapeño 不仅专为 OpenAI 自家的模型而设计,也适用于其他架构的通用推理平台。SemiAnalysis 援引开发者的演示作为硬件灵活性的佐证:他们演示了从 OpenAI 自家编程助手 Codex 移植过来的游戏 Doom 甚至可以在该芯片上运行。虽然此类演示缺乏经济实质,但它们确实表明该架构的应用范围并不局限于狭窄的领域,而是可以处理更通用的计算任务。.
效率提升转化为实实在在的收益。
结果证实了Jalapeño芯片的超高效率。在某些情况下,OpenAI的这款芯片每瓦的令牌生成率是Nvidia B300的22倍,对于一家没有数十年半导体经验的公司来说,这是其首款自主研发芯片的卓越成果。Jalapeño芯片甚至可以与目前正在向主要客户推广的Vera Rubin新系统相媲美,尽管目前用于对比的可靠数据较少,最终评估仍在进行中。.
然而,SemiAnalysis 指出了一些方法论上的局限性,这些局限性使得我们对这些数据的意义有了更客观的认识。测试仅使用了相对较小的提示规模,输入标记数为 8,192,输出标记数为 1,024。而许多生产环境中的代理应用通常会使用更大的提示规模,这可能会显著改变测试结果。此外,测试版本使用的是早期的 A0 步进,而目前生产环境中使用的是优化的 B0 步进,OpenAI 声称其效率将提高约 25%。从经济角度来看,这意味着,假设有关 B0 步进的声明得到证实,那么目前已经非常可观的数据可能代表的是实际潜力的下限,而非上限。.
真正的优势不在于芯片,而在于电网。
OpenAI 的芯片甚至可能比 Vera-Rubin 的芯片更具成本效益,因为英伟达的系统在测试中受益于推测性解码(一种加速文本生成的技术),而 Jalapeño 则无法进行这种优化。总体而言,内部硬件推理应该能显著降低 OpenAI 的成本,因为该公司不再需要向外部供应商支付贸易利润,而且架构可以根据自身的服务模式进行精确定制。.
然而,真正的战略优势并非主要体现在单个芯片成本的降低,而是体现在能源效率上。由于效率的提高,在相同的功率输入下可以运行更多的芯片,这在电力供应和电网连接容量已成为行业增长限制因素的行业中,才是真正的竞争优势。OpenAI 本身已在美国签署了超过 10 吉瓦的计算能力合同,这一目标最初设定于 2029 年,如今已提前数年实现。在新建电厂容量和电网连接往往是数据中心扩张真正瓶颈的环境下,每一瓦的更高效利用都能直接转化为额外的可用计算能力,而无需新建电厂。.
这种发展速度对芯片行业构成了挑战
该项目的研发速度尤其值得关注。据 OpenAI 称,从组建研发团队到芯片流片(即完成设计并获得生产许可)仅用了 16 个月,而首个完整设计据说在流片前九个月就已完成。在传统的半导体行业,对于类似复杂度的芯片,三到五年的研发周期被认为是标准周期,因此,如果这种速度在未来的几代产品中得以延续,可能会对整个行业现有的成本结构构成压力。.
OpenAI 表示,这得益于其在设计过程中大量运用了自身的人工智能系统。这使得设计决策的评估速度更快,同时还有助于优化计算单元,从而显著缩短了芯片设计中传统的迭代周期。这形成了一种自我强化的效应:公司的人工智能模型越强大,就能越快速、越经济高效地开发出新一代芯片,而新一代芯片又能更高效地执行这些模型。如果这种反馈机制能够被证实可复制,那么对于那些既拥有领先的人工智能模型又具备自主芯片开发能力的公司而言,它将成为一项结构性优势。.
当你的人工智能成为工程师的工具箱
Astra是计划中的下一代GPT模型,OpenAI已经利用它为新模型开发优化的计算核心(或内核)。据报道,Astra在GPT-OSS中生成的代码比人类专家团队开发的同类程序快50%到80%。这一发现的经济意义远比表面看起来更为深远,因为它表明,软件优化这一瓶颈——迄今为止,软件优化一直严重依赖于高素质工程师的参与——正逐渐被自动化系统所解决。.
对整个半导体行业而言,这意味着竞争格局可能发生重组。此前,数十年的经验、深厚的工程知识以及像英伟达CUDA这样成熟的软件生态系统,几乎被视为新供应商难以逾越的准入壁垒。如果人工智能工具能够部分弥补这种经验优势,那么其他竞争者的准入门槛将会降低,从长远来看,这可能会导致目前高度集中的人工智能加速器市场出现碎片化。.
🎯🎯🎯 数据驱动的 B2B 行业中心,作为一种准内部解决方案
Xpert.Digital 是一个以数据驱动的 B2B 行业中心,由 Konrad Wolfenstein 领导。该公司为工业合作伙伴提供外部的、准内部解决方案,弥补其在市场营销、内容和销售方面的运营缺口,而无需客户投入额外资源。.
更多信息请点击这里:
OpenAI 的 Jalapeno 芯片:为什么架构比原始计算能力更重要
硅芯片中的架构即成本核算
OpenAI 在 Jalapeño 芯片的设计中做出了一些有趣且经济合理的决策。例如,该芯片的矩阵单元不支持使用 16 位 FP16 浮点格式进行计算,这显著简化了内部逻辑,并符合业界向量化模型(即数值精度较低的模型)发展的趋势。64 位和 32 位数据类型仅由额外的标量单元和向量单元支持,其中向量单元也仅限于 32 位计算。通过省略不常用的计算格式而节省的晶体管面积可以用于增加内存带宽或更多处理核心,以支持实际需要的格式,从而提高每个芯片的成本效益。.
就纯粹的FP8和FP4计算能力而言——这两种数值格式对于现代量化语言模型尤为重要——OpenAI的芯片分别拥有3.4和13.4 petaFLOPS的计算能力,理论上落后于Nvidia的Blackwell(分别为5和15 petaFLOPS)。然而,这种看似劣势的数据会被实际系统利用率所弥补,因为芯片在实践中很少能达到其理论峰值性能。据业内人士称,目前的加速器在实际推理工作负载下通常只能达到其理论效率的30%到50%。因此,即使芯片的原始性能在纸面上看起来较低,但如果其性能更接近自身峰值,那么在实际应用中,它仍然可以保持竞争力,甚至超越峰值性能。.
选择以内存带宽而非原始计算能力作为战略考量
该芯片配备了六个HBM4内存堆栈,使其内存带宽几乎是Blackwell的两倍,达到每秒15.4 TB,而Blackwell仅为每秒8 TB。这一设计体现了设计者的深思熟虑,因为在推理大型语言模型时,限制因素往往并非纯粹的计算能力,而是模型权重和中间结果在内存和算术逻辑单元(ALU)之间传输的速度。专门针对这种所谓的内存带宽瓶颈而设计的芯片,在实际应用场景中比那些标称计算能力更高但内存访问相对受限的竞争对手效率更高。.
由于采用了八个内存堆栈,Blackwell 和即将推出的 Rubin 一代芯片的总内存容量高达 288 GB,而 Jalapeño 芯片仅有 216 GB。对于具有相应宽广上下文窗口的大型模型而言,较低的内存容量可能会成为限制因素,尤其是在未来模型规模更大、内存需求更高的情况下。该芯片的 TDP(最大热设计功耗)为 700 瓦,但 OpenAI 表示,该芯片在实际运行中平均仅需约 550 瓦的功耗。对于日常数据中心运营而言,这比理论峰值功耗更具经济意义。.
延迟与灵活性:一种权衡之策
这款芯片的内存层级结构很有意思。OpenAI 将芯片划分为多个计算组(或称“切片”),每个计算组都分配了固定的 HBM 内存。这种处理核心与本地内存之间紧密且固定的耦合显著降低了访问延迟,因为每个计算组都可以直接、低延迟地访问自己的内存分区,而无需像传统 GPU 架构那样遍历多级共享内存系统。然而,这种速度优势的代价是内存分配灵活性降低,因为一旦某个分区达到其容量上限,就无法在计算组之间随意重新分配内存。.
这些组通过两个独立的网络层连接:一个专用的、延迟极低的集体网络,用于处理频繁重复且定义明确的通信模式,例如并行处理期间的同步;以及一个更通用的片上网络,用于其他通信以及访问多个芯片之间更高级别的扩展网络。这种架构划分使得大部分内部数据流量可以通过速度更快的专用路径处理,而通用网络则仅用于不频繁、对时间要求不高的访问。从经济角度来看,这是专用性和通用性之间的一种经典权衡,是专用推理芯片的典型特征,与传统图形处理器的通用架构有着本质区别。.
收缩压阵列是TPU理念的传承
与许多其他专用AI加速器一样,Jalapeño采用脉动阵列,其中中间结果直接在相邻的处理单元之间传递,而不是在内存和算术逻辑单元之间不断往复循环。这种概念并非全新,而是遵循一种经过多年实践检验的架构理念,尤其是在谷歌的张量处理单元(Tensor Processing Units)中,该架构已在特定AI工作负载中实现了类似的效率提升。.
与传统的大型脉动阵列设计不同,据 SemiAnalysis 报道,Jalapeño 还支持更小的矩阵维度,从而避免了当批处理大小或矩阵维度与固定阵列大小不完全匹配时常见的性能下降问题。此外,该芯片配备了专用的 64 位标量核心以及支持 FP32 和 INT32 的向量单元,并采用乱序执行方式,每个处理核心都配备经典的 L1 缓存,而不是像许多其他加速器那样依赖软件控制的暂存存储器。这种专用矩阵单元与更灵活的标量和向量逻辑的结合表明,OpenAI 有意在纯粹的专业化和通用可编程性之间寻求一种平衡。.
为什么降低成本并不能立即惠及客户
从企业客户和开发者的角度来看,眼下最紧迫的问题是,承诺的效率提升是否也能带来更低的API价格。多位行业分析师认为,短期内不太可能出现这种情况,因为OpenAI目前主要受产能限制而非成本限制。这意味着,单位成本的降低最初将转化为更大的可用容量,而非更低的价格。历史案例,例如谷歌推出自有TPU或亚马逊推出Trainium芯片,都表明终端用户的价格通常只有在新专有硬件广泛推广后的12到24个月才会下降,而这通常是由竞争对手加大竞争压力所驱动的。.
此外,OpenAI必须先通过几个季度的推理收入收回其在设计、制造和基础设施方面的大量前期投资,才能真正实现成本节约并转化为更高的利润率。在此之前,该芯片的主要作用可能是缓解现有的容量瓶颈,例如减少API访问的长时间等待或速率限制,而不是立即降低价格。尽管如此,对于制定人工智能服务中期预算计划的公司而言,将未来两到三年内成本逐步降低30%至50%作为一项现实的规划方案似乎是合理的。.
这是一场争夺市场力量的竞争,而不仅仅是争夺功率。
这一发展背后更深层次的战略原因在于,企业都在努力摆脱对单一市场主导供应商的依赖。多年来,英伟达一直掌控着人工智能训练和推理硬件市场的绝大部分份额,从而获得了巨额利润,而这些利润最终都转嫁给了客户。如果OpenAI像谷歌、亚马逊和微软那样,将相当一部分推理工作负载转移到自己的硬件上,那么即使英伟达仍然是训练新模型的主要合作伙伴,它与最大客户的议价能力也会下降。.
值得注意的是,英伟达一方面为OpenAI的数据中心扩建提供巨额资金支持,例如通过数十亿美元的贷款在俄亥俄州新建数据中心;另一方面,OpenAI也在研发自己的芯片平台,这可能与英伟达的策略形成竞争。这种看似矛盾的局面,从经济角度来看,其实是双方理性行为的体现:英伟达从其最大的单一客户那里获得了长期采购承诺和资金支持,而OpenAI则在不损害与最重要的训练合作伙伴关系的前提下,逐步实现其推理工作负载的战略独立性。.
从发布到量产
Jalapeño 的初期小规模出货计划于 2026 年底进行,而大规模生产和全面推广预计将在 2027 年全年完成。在此之前,英伟达(尤其是通过继续使用其 Vera Rubin 系统)仍将是 OpenAI 基础设施的核心组成部分,这意味着完全放弃英伟达硬件并非在计划之中。相反,一种混合模式正在兴起,在这种模式下,不同代际和不同供应商的硬件将并行用于不同的工作负载。.
从长远来看,Jalapeño 的真正意义或许不在于第一代产品的具体效率数据,而在于其展现出的研发速度以及利用人工智能工具进行自身硬件开发的能力。如果这种更强大的模型和更快的芯片开发周期之间的良性循环能够被复制,不仅会改变 OpenAI 相对于英伟达的竞争地位,还会从根本上改变人工智能应用新一代半导体产品的开发时间表。.
📈🚀 从提升知名度到赢得信任 👀🤝 Xpert.Digital 助您实现规模化发展
在工业B2B领域,可持续的业务关系很少一蹴而就。它们需要循序渐进地发展——通过提升知名度、增强专业相关性、建立持续的联系以及不断增长的信任。Xpert.Digital的四阶段模型正是针对这一需求而设计的:它提供了一条结构化的路径,从易于管理的切入点开始,并可根据需要发展为更深入的业务拓展合作。.
这种模式不依赖于夸张的营销承诺,而是将合作关系置于首位。企业首先制定清晰明确、易于计算的衡量指标,然后根据自身经验决定合作的拓展程度。这种不受干扰的信任建立过程的关键在于:平台完全杜绝了令人厌烦的广告,因此内容完全聚焦于企业的专业知识。.
更多信息请点击这里:
您的全球营销和业务拓展合作伙伴
☑️ 我们的业务语言是英语或德语。
☑️ 新增:用您的母语进行通信!
我和我的团队很乐意为您提供私人顾问服务。.
您可以通过填写此处的联系表格联系我wolfenstein@xpert.digital:,或者直接致电+49 7348 4088 965。我的邮箱地址是
我期待着我们的合作项目。.


