OpenAI自研芯片Jalapeno实测跑赢英伟达:AI推理成本战正式打响
8月26日,OpenAI在Hot Chips大会上正式公布首款自研AI推理芯片Jalapeno的性能数据。SemiAnalysis独立测试显示,该芯片在峰值吞吐量下每瓦性能达到英伟达GB300的1.5至1.9倍,端到端延迟降低1.7至3.6倍。对于高交互性工作负载,性能提升最高达4.1倍。这是OpenAI从”最大GPU买家”向”自建算力基础设施”转型的关键一步,也是AI推理成本竞争进入白热化阶段的标志性事件。
Jalapeno芯片:从设计到流片仅用9个月
Jalapeno由OpenAI与博通合作开发,台积电3nm制程代工。从初始设计到完成流片仅耗时9个月,期间OpenAI用自身AI模型辅助优化硬件工程流程。芯片额定功耗700瓦,实测持续功耗维持在550瓦或以下。
技术架构上,Jalapeno采用全栈协同设计:芯片、内存、网络、软件及机架级系统一体化优化。KV缓存等模型状态可显式放置并保持本地,最大限度减少数据传输和通信延迟。内存采用HBM4新一代高带宽内存,由SK海力士和三星电子供应。
测试覆盖了GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T三个大模型。在Kimi K2.5 1T上,Jalapeno每瓦峰值性能约为参照系统的1.5倍,端到端延迟降低3.4倍。OpenAI硬件负责人Richard Ho在斯坦福大学HotChips大会上表示,Jalapeno的真正对手将是同样采用HBM4的英伟达下一代Vera Rubin平台。
为什么重要:推理成本是AI商业化的最大瓶颈。训练成本是一次性投入,推理成本却伴随每一次用户请求持续发生。OpenAI自研芯片直接瞄准这个最大可变成本,意味着未来12到18个月推理单价有进一步下探空间。对企业用户而言,这是实实在在的利好。
腾讯混元Hy4 preview同日开源:770B参数的生产力巨兽
8月28日,腾讯混元发布并开源新一代大语言模型Hy4 preview,总参数770B、激活参数49B,上下文长度突破1M tokens。这是混元自2月重建基础设施以来的第三次大版本迭代,平均每两个月发布一个新版本。
Hy4 preview采用MoE架构,78层中第1层为dense FFN,其余77层每层配置256个路由专家加1个共享专家,每token激活top-8路由加1个共享。在腾讯内部组织的163名专家、203个工程任务盲测中,Hy4 preview均分2.99/4.00,略优于GLM 5.3的2.92/4.00和Kimi K3的2.94/4.00。
定位”为生产力而生”,Hy4 preview在代码、办公、科学等真实场景表现突出。软件工程方面增强长程开发任务的理解、规划、调试与验证能力;办公场景优化数据分析、跨文件协作,完成从信息处理到文档交付的完整流程;游戏开发实现一句话生成可玩原型;科学研究在分子动力学模拟、凝聚态物理等领域均有长足进步。
API定价延续普惠路线:输入6元/百万tokens,输出18元/百万tokens,缓存命中0.3元/百万tokens。Hy4 preview已在WorkBuddy、CodeBuddy、元宝、ima等腾讯产品同步首发,并通过腾讯云TokenHub和OpenRouter接入全球API。
为什么重要:Hy4 preview首次参与自身研发迭代,能够自动优化训练方法、数据策略、评估体系和底层算子,形成初步的递归自我改进闭环。它还自主分析推理系统瓶颈,通过算子融合、通信优化等方向开展多轮优化,端到端吞吐量相较基线提升31.8%。这标志着大模型开始具备自我改进能力,是通向AGI的关键里程碑。
AI芯片格局:自研、开源与国产算力的三重变奏
Jalapeno和Hy4的接连发布,揭示了2026年AI产业的三个深层趋势。
第一,自研芯片从”可选项”变成”必选项”。OpenAI不是第一个自研芯片的AI公司,但它是体量最大的。谷歌TPU、亚马逊Trainium、微软Maia都已布局,OpenAI的加入意味着头部AI公司全部拥有自研芯片能力。英伟达的训练侧护城河短期难以撼动,但推理侧的定价权正在松动。
第二,开源模型能力逼近闭源旗舰。Hy4 preview在盲测中超过GLM 5.3和Kimi K3,加上阿里Qwen3.8-Flash、智谱GLM-5.3-Flash等同日发布,中国开源模型已形成密集火力网。据HuggingFace《2026年春季全球开源AI生态报告》,中国开源模型下载占比已达41%,首次超过美国。
第三,国产算力首次大规模承接前沿模型推理。智谱GLM-5.3-Flash是国内前沿大模型首次大规模线上流量完全跑在国产算力之上。Hy4 preview的推理系统优化也展现了国产算力承载千亿级MoE模型的能力。MoE架构通过稀疏激活降低单token计算压力,让国产算力有机会承接前沿模型,形成正向循环。
推理成本下降:AI商业化的最后一道门槛
Flash模型和自研芯片的共同目标只有一个:降低推理成本。
阿里Qwen3.8-Flash训练成本较前代下降近90%,推理定价每百万tokens输入0.8元、输出2.7元,最低仅为DeepSeek-V4-Flash的三分之一。智谱GLM-5.3-Flash API价格仅为自家上一代旗舰的十分之一,约为Claude Opus 4.8的四十分之一。OpenAI的Jalapeno芯片每瓦性能提升1.5至1.9倍,意味着同等算力下可服务更多用户,或同等用户量下降低能耗成本。
成本下降正在改写商业逻辑。MiniMax CEO闫俊杰在财报会议上表示:”降价和提升毛利率并非矛盾。只要单位Token毛利率保持正向并持续改善,规模扩大就会带来更高的绝对毛利。”过去降价是赔本换流量,现在架构创新带来真实的成本下降,厂商可以在合理毛利区间内持续压低报价。
对企业客户和开发者而言,这意味着AI应用的大规模商用从经济上变得可行。长上下文、多模态、Agent智能体等刚需场景,不再需要承受千亿稠密模型的算力开销。MoE-Flash提供的折中解法——接近旗舰的综合能力、推理成本下降一个数量级——正在打开企业级AI应用的规模化窗口。
OpenAI计划2026年底前在自有计算基础设施中开始部署Jalapeno,第二代芯片正在深度开发,第三代已初具雏形。腾讯混元表示Hy4系列下一批模型近期陆续上线。芯片与大模型的竞赛,正在从参数规模转向效率与成本的深层较量。