
8 月 26 日消息,OpenAI 公布首款自研推理芯片 Jalapeño 首批实测成绩,在吞吐、能效与延迟三项指标上全面超越英伟达 GB200 与 GB300。根据 OpenAI 与 SemiAnalysis 在 InferenceX 基准上的测试结果:
在 GPT-OSS 120B 上,单用户出词速度达 1459 tokens/s,是 GB200 535 tokens/s 的 2.7 倍;
在 DeepSeek R1 670B 上,端到端延迟 1.65 秒,对比 GB300 的 5.99 秒;以 GB300 最快解码速度为基准,每千瓦吞吐达到对方的 104.3 倍;
在 Kimi K2.5 1T 上,峰值每瓦吞吐提升约 1.5 倍,延迟降低约 3.4 倍;
三款模型整体每瓦 AI 工作量提升 1.5 至 1.9 倍,高交互场景性能提升 2.1 至 4.1 倍。
Jalapeño 标称功耗 700W,仅为 GB300 的一半;SemiAnalysis 估算其每芯片每小时总拥有成本约 1.56 美元,与英伟达 H100 基本持平,低于 Vera Rubin 的 3.61 美元。
OpenAI 表示,Jalapeño 从设计到流片仅用九个月,过程中借助自研模型 GPT-Astra 与 Codex 加速电路设计与验证,AI 辅助让 SIMD 单元面积减少 8%、矩阵引擎面积减少 10%;在部分注意力与 MoE 模块上,AI 生成的内核比人类专家实现快 1.5 至 1.8 倍。
去年 10 月,OpenAI 与博通签署了 10GW 定制加速器合作协议,Jalapeño 是该路线图的第一代产品,Gen 2 已在深度开发,Gen 3 正在成形。官方称将在今年年底前把 Jalapeño 部署进自有算力基础设施。