OpenAI 8月25日公布首款自研推理芯片Jalapeño的首批实测:在GPT‑OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T三类开放模型上,峰值吞吐能效提高约1.5至1.9倍,端到端延迟降低约1.7至3.6倍;高度交互负载的性能提升约2.1至4.1倍。公司计划年底前开始部署。真正值得市场重估的不是一场“打败Nvidia”的标题战,而是OpenAI能否把推理成本、响应速度与代理完成任务的等待时间同时压低,并把节省下来的电力和资本开支转成更好的毛利。
一、这次公布的是实测,不再只是路线图
OpenAI 6月首次公开Jalapeño时,核心表述是实验室样片、年底部署和多代平台。最新公告给出了InferenceX公开基准中的具体结果,覆盖自家GPT‑OSS及DeepSeek、Kimi等外部模型。这比只测试为芯片定制的单一模型更有说服力。
但结果仍由OpenAI发布,尚未经历大规模生产运行、第三方成本审计和长期稳定性验证。Buy验证需要部署后的利用率、故障率、软件成熟度和每个成功任务成本,而不是实验室峰值。
二、1.5至1.9倍能效代表什么
推理是模型向用户持续输出答案的阶段。使用量越大,电力、机架、网络和散热越接近长期成本中心。OpenAI称Jalapeño在三个公开模型的峰值吞吐下,每瓦可完成的AI工作提高1.5至1.9倍;芯片额定700瓦,测试中的持续功耗不高于550瓦。
若生产环境复现,同一数据中心电力可以服务更多tokens与代理步骤,或在相同负载下降低成本。但能效提升并不自动等于利润:更低价格可能刺激使用量,新增需求也可能吞掉全部节省。
三、延迟下降为何对AI代理更重要
普通聊天少等一秒只是体验改善,代理任务却可能连续调用模型几十至几百次。每一步延迟会累积,最终决定用户是否愿意把复杂工作交给系统。OpenAI报告端到端延迟降低1.7至3.6倍,高度交互负载性能提高2.1至4.1倍。
因此Jalapeño的价值不只是每token更便宜,而是让代码、研究、客服和办公代理在可接受时间内完成更多步骤。真正的商业指标应是每个成功任务的总时间、重试次数和成本。
四、为什么不能简单说Nvidia被替代
Jalapeño目前针对推理,而不是训练。OpenAI也明确表示将继续广泛部署Nvidia及其他伙伴的加速器,用于训练和推理。最新比较使用公开可购系统与标准化芯片功耗,但没有覆盖Nvidia未来所有架构、软件优化和整机配置。
Nvidia的护城河包括CUDA、训练、网络、软件库、开发者和快速迭代。Jalapeño证明自研芯片可以夺走部分稳定推理负载,却尚未证明OpenAI能摆脱Nvidia训练平台。
五、Broadcom获得的价值可能比市场想象更大
OpenAI负责架构与工作负载理解,Broadcom提供硅实现、网络和连接技术,Celestica参与板卡、机架与系统。定制芯片的经济价值不只在单颗ASIC,还包括交换、光连接、封装和系统整合。
若OpenAI年底按计划部署并扩展到多代平台,Broadcom可获得长期设计与网络收入。但定制客户议价能力强、单一项目集中、开发成本高,收入规模与毛利仍需正式订单验证。
六、九个月tape-out说明AI开始改变芯片开发
OpenAI称Jalapeño从设计到tape-out仅用九个月,AI参与实现探索、测量、验证和算术电路优化。团队还用Codex与GPT‑Astra在两个月内让三种原计划之外的开放模型达到高性能。
部分注意力与MoE模块的AI生成实现比原有人类专家版本快1.5至1.8倍,但这只适用于选定模块,不代表全模型同幅提升。关键是开发循环变短:芯片、编译器和模型可以共同迭代。
七、性能比较需要哪些保留条件
OpenAI按各加速器公开额定功耗标准化结果,并使用InferenceX测量完整请求服务。这个方法比只报芯片算力更接近用户体验,但仍会受到量化格式、批处理、输入输出长度、系统配置、软件版本和模型优化影响。
投资者不应把单一倍率直接外推到所有OpenAI模型与客户。需要第三方复测、生产负载分布、机架总功耗、网络与冷却成本,才能计算真正的每token和每成功任务成本。
八、推理成本下降如何影响OpenAI毛利
若收入增长快于服务成本,Jalapeño可以提高经营杠杆;若OpenAI把全部节省通过降价让给客户,毛利改善会有限,但可能换来更大市场份额与使用量。代理产品的需求弹性尤其重要。
Buy验证是单位成功任务成本下降、API价格保持、总任务增长且毛利改善。Sell或降低估值条件,是芯片节省被软件迁移、低利用率、良率或快速贬值抵消,资本开支仍快于收入现金流。
九、数据中心电力成为真正约束
OpenAI选择按每千瓦吞吐比较,反映行业瓶颈已经从买不到芯片扩展到拿不到电力、并网、散热和机架空间。在固定电力下提高1.5至1.9倍工作量,可能比单颗芯片价格下降更有价值。
但芯片额定功耗不是整个数据中心PUE。网络、内存、CPU、冷却与备用电力仍会消耗能源。只有机架和园区级测量才能确认对资本开支与电费的净影响。
十、对Nvidia、Broadcom与云平台的分配
Jalapeño更可能改变增量推理份额,而不是立即替换存量GPU。Nvidia仍可从训练、前沿模型和通用负载获益;Broadcom从定制ASIC和网络获得份额;云平台则要决定采购GPU、TPU、自研芯片或OpenAI系统。
市场应观察收入池如何重新分配,而不是只问谁赢谁输。若总体AI需求扩张快于自研芯片替代,Nvidia收入仍可增长;若推理快速转向定制ASIC,其混合毛利与定价权可能先承压。
十一、Gen 2与Gen 3才决定平台价值
OpenAI称Gen 2已深入开发、Gen 3正在成形。第一代芯片能否按期量产只是入场券,多代迭代速度、软件兼容性和模型迁移成本才决定平台能否持续。
若每一代都能利用真实工作负载快速优化,OpenAI会形成模型—产品—芯片—数据中心闭环;若第一代只适合少数模型,维护成本会侵蚀节省。
十二、Buy与Sell验证框架
Buy验证包括:年底按期部署;第三方复测接近官方倍率;生产持续功耗、利用率和稳定性达标;单位成功任务成本下降;Broadcom订单与网络收入兑现;OpenAI毛利或价格竞争力改善;同时保持Nvidia训练能力。
Sell或降低权重条件包括:量产延期、良率或软件适配困难;实验室倍率在生产负载明显收窄;自研芯片资本开支增加但利用率不足;降价吞掉全部节省;或Nvidia新一代系统迅速缩小能效差距。
十三、当前判断
当前方向为Watch。Jalapeño首次用跨模型公开基准证明OpenAI自研推理芯片不只是概念:能效与延迟同时改善,尤其适合连续多步的代理任务。但它仍是部署前的首批结果,且不承担训练。
下一次真正的重估点不是更多峰值图表,而是年底部署规模、每个成功任务成本、机架总功耗、OpenAI毛利、Broadcom收入和Nvidia推理份额。若这些指标共同兑现,自研芯片会从技术新闻变成AI利润结构变化。
AI辅助观察:本文由影子Allen依据OpenAI 8月25日官方实测公告、6月24日Jalapeño发布资料及Axios公开报道整理,仅用于Allen市场手记研究和内容演示,不代表Allen本人真实观点、持仓或投资建议。Buy/Sell仅为分析标签。
主要公开来源: OpenAI:Jalapeño首批实测;OpenAI:Jalapeño与Broadcom平台发布;Axios:芯片定位与市场背景。