OpenAI自研「辣椒芯片」首测超英伟达,会让ChatGPT更便宜吗?
做芯片很难,第一代产品就做到有竞争力更难。OpenAI 这次交出的答案,至少在大模型推理这件事上,已经足够夸张。
今天,OpenAI 正式公布了其首款定制推理芯片 Jalapeño(墨西哥辣椒)的首批实测性能数据。
在基于自己开源模型 GPT-OSS 120B 的公开基准测试 InferenceX 上,Jalapeño 的每千瓦峰值吞吐量和 Token 延迟都比现有的硬件系统表现要好。
要知道,对大多数芯片来说,吞吐和延迟往往是一道只能二选一的难题。而除了针对 OpenAI 的大模型优化明显,芯片在 670B 的 DeepSeek R1 和 1T 的 Kimi K2.5 上表现也更出色,对手都是英伟达 GB200/GB300 等市面上最强的商用 AI 系统。
奥特曼在 X 上毫不客气地评价:「我们造了一颗芯片,快得离谱。」
知名科技 Newsletter SemiAnalysi 创始人 Dylan Patel 更给了极高的评价,「第一代芯片通常毫无竞争力,但 OpenAI 正在打败英伟达 Blackwell,甚至 Rubin。」
更巧的是,OpenAI 并不是这几天唯一一家谈芯片的公司。
小米刚刚一口气公布三颗自研芯片,苹果昨天发布首颗 2nm M6,接下来一个月,高通、联发科、苹果和华为的新一代旗舰芯片还会继续扎堆登场。
从数据中心到手机,AI 芯片正在成为所有科技巨头共同争夺的一块地盘。
一份近乎「不讲理」的成绩单
先看 Jalapeño 的数据,OpenAI 这次采用 InferenceX 测试,统一设置为 8K 输入、1K 输出,使用标准单 token 预测,没有开启推测解码。对照系统包括英伟达 GB200 和 GB300。
OpenAI 将 DeepSeek R1 与 Kimi K2.5 标为 MXFP4,在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 三个模型上的结果显示:
峰值吞吐量,每瓦的 AI 工作量是对比系统的 1.5 到 1.9 倍,
端到端延迟降低了 1.7 到 3.6 倍,
对于高交互性工作负载,其性能更是提升了 2.1 到 4.1 倍。
在最极端的对比项里,差距被拉得相当大,GB200 此前最佳的单用户速度(约 535 tok/s)下,Jalapeño 的每千瓦吞吐是前者的 53.7 倍。
跑 DeepSeek R1 时,Jalapeño 单用户可达 700 tok/s,对标系统只有 169 tok/s。而 Jalapeño 标称功耗仅 700W,实测持续功耗不超过 550W。
对于规模化推理服务来说,芯片最终拼的除了跑得多快,还有花同样的电、占同样的数据中心容量,能服务多少用户。
换成云计算生意里的语言,就是一句很直接的话:「每瓦吞吐,最后都会变成成本和收入。」
▲跑 DeepSeek R1 时,Jalapeño 单用户生成速度最高约 700 tok/s,GB300 为 169 tok/s。
更值得注意的是 OpenAI 这颗辣椒芯片的达成方式:没有多 token 预测(MTP)、没有投机解码、没有 prefill-decode 分离,就这样赢过了软硬件优化的英伟达对手芯片。
SemiAnalysis 长篇技术博客里也验证了测试过程,并确认 Jalapeño 跑出的 GSM8k 精度与英伟达芯片持平。
▲文章链接:https://newsletter.semianalysis.com/p/openai-jalapeno-better-than-nvidia
当然,X 上的讨论也没少泼冷水。daily.dev 的开发者社区就指出,那个疯传的「104.3 倍」只是特定等速解码场景下的单一数据点,而且测试模型和对比基线都是 OpenAI 自己挑的。
SemiAnalysis 也承认,Jalapeño 还没跑过多轮长上下文的 AgentX 测试;真正的对手应该是同样用 HBM4 的 Vera Rubin 而非 Blackwell。
即便如此,最终的共识依然是:第一代自研芯片就站上帕累托前沿,这在行业里没有先例。Meta 和微软折腾多年始终难产的 AI ASIC 项目,是最好的反证。
非 OpenAI 模型独家专用,是通用推理引擎
外界一度认为 OpenAI 造芯是给自家模型开小灶,SemiAnalysis 则提到 Jalapeño 是通用推理芯片。测试表现最好的三个模型里,DeepSeek R1 和 Kimi K2.5 根本不在 OpenAI 最初的投产计划内。
团队还提到用 Codex 两个月就把它们优化到了高性能,并且在这颗芯片上成功运行了游戏《Doom》,移植全程只用了 Codex 提示词。
主题:芯片|Jalapeño|吞吐|DeepSeekR1