一台700瓦的芯片,把英伟达1400瓦系统的每瓦性能甩开1.9倍。这不是PPT,是SemiAnalysis创始人迪伦·帕特尔走进OpenAI实验室亲眼验证过的数据。测试用的是公开基准InferenceX,三个模型跑完,Jalapeño在端到端延迟上领先1.7至3.6倍,高交互场景性能高出2.1至4.1倍。
希鸥网观察到,这颗OpenAI与博通合作开发的推理专用ASIC芯片,只做推理不做训练,今年6月首次公开,两个月后交出的成绩单已经进入竞争区间。测试覆盖GPT-OSS 120B、DeepSeek R1 670B和月之暗面Kimi K2.5 1T三个模型,后者是本次规模最大的测试对象,一万亿参数下的每瓦性能仍高出1.5倍。需要划清边界:对比对象不含英伟达Rubin,数据由OpenAI提供,SemiAnalysis只完成了部分验证。
先算一笔电力的账。数据中心能接入多少电,受电网、散热和备用电源限制,增加芯片容易,增加可用电力要数年。黄仁勋在Computex 2026上说得直白:“如果你有一吉瓦电力,那么每瓦的吞吐量,就是收入。”Jalapeño标称700瓦,GB300标称1400瓦,OpenAI采用双方公开的芯片封装功耗做归一化。电力封顶时,谁能用相同功率生成更多token,谁就能在同一座数据中心服务更多用户。
再看芯片本身。通用加速器要兼顾训练推理,Jalapeño从诞生起就围绕语言模型推理设计,尤其针对需要连续执行多步骤的智能体负载。做法是让模型状态和KV缓存尽量贴近计算单元,把网络算进整体架构,减少芯片间的数据搬运。单颗芯片配备6组HBM4,总容量216GB,带宽15.4TB/s,功耗持续保持在550瓦以下。
最反常识的地方在于AI开始参与芯片本身的设计。从设计到流片只用了九个月,团队组建前后约十六个月。工程师用OpenAI自研的Gluon语言编写内核,内部Codex配合GPT-Astra参与代码生成,两个月内把三个不在生产计划中的开放权重模型适配到了Jalapeño上。在部分注意力模块和混合专家模块中,AI生成的实现比人类专家版本快1.5至1.8倍。过去ASIC的最大软肋是适配成本,现在模型能自动生成、测试和优化底层代码。
希鸥网认为,这场博弈的微妙之处在于OpenAI和英伟达的关系远没到翻篇的时候。近日英伟达宣布为SB Energy在俄亥俄州PORTS-Pike园区提供信用支持,上限可能达1050亿美元,作为交换,该园区将独家采用英伟达计算平台。OpenAI一边签下20年租约继续扩张英伟达算力,一边拿出自研推理芯片。Jalapeño只做推理,训练仍然依赖英伟达。更大的变量是HBM4供应,OpenAI与博通去年10月公布的10GW多代自研加速器计划,将让OpenAI成为HBM4市场的重要买家,也在全球最紧缺的零部件供应上插下一面旗。
创业者在Jalapeño身上应该看到的,不只是芯片性能。OpenAI从零组队到流片只用十六个月,靠的不是单打独斗,而是与博通的深度协作和AI工具的全程介入。博通负责制造和供应链,OpenAI专注架构和软件栈,SemiAnalysis作为第三方验证方提供可信度加权。真正高效的团队,不是每个人都做同一件事,而是找到目标一致的合作者,把各自的专业能力放在最匹配的位置上。
十六个月组建一支能做芯片的团队,选人比流程更重要。OpenAI没有时间培养新人,需要的是经历过多次流片、踩过坑的工程师。过去做芯片的履历、失败过的项目经验、在成熟大厂独当一面的记录,比任何学习成绩都更能说明问题。招聘的核心原则是找出色的人,而不是“此类即可”。人岗错配是创业公司最大的隐性成本,一个不合适的人占据关键位置,消耗的不只是薪酬,还有整个团队的节奏。
Jalapeño的测试结果还揭示了一套反馈机制的威力。AI生成的内核代码被不断评估、比较、迭代,才有部分模块快1.5至1.8倍的成绩。OpenAI特意注明这些数字不能外推到整个模型,这种对数据边界的克制,恰恰是准确评价的体现。多数团队的问题不是反馈太少,而是批评太软。准确评价比善意更有价值,从失败中学习与从成功中学习同样重要。AI参与开发最大的意义,是让反馈变得即时、具体、可量化,每个模块都能被持续打磨。
金鸥品牌榜·2026年度创新案例库开放申报了。免费提报,独立评估,入榜品牌将获得电子版《入榜证明》及年度专题公示,优秀案例可获得深度专访+全平台分发。如需修改或发布文章,请加微信号:sheisceo