大模型推理芯片的竞争,正在从“谁算得快”转向“谁吐字更省”。今天,OpenAI 自研推理芯片 Jalapeño 首次公开了实测跑分数据,涵盖 Token 吞吐、生成延迟和单位功耗推理性能等关键指标。这些数字不再只是规格表上的纸面参数,而是直接指向数据中心最头疼的问题:当 ChatGPT 需要持续回消息、Reasoning 模型要生成长链路内容、Agent 会一轮接一轮调用模型时,芯片能否在功耗墙内把 Token 稳定吐出来。雷峰网报道称,Jalapeño 在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 三款模型上,峰值吞吐下每瓦完成的 AI 工作提升约 1.5~1.9 倍,端到端延迟降低约 1.7~3.6 倍;在交互速度要求较高的区间,性能提升达到约 2.1~4.1 倍。芯片额定功耗为 700W,这批负载中的持续功耗未超过 550W。
要理解这些数字为何围绕 Token 展开,需要先拆解大模型推理的内部流程。输入 Prompt 时,模型进入 Prefill 阶段:假设一次输入 8K Token,这些 Token 可以大规模并行计算,模型权重从 HBM 取出后被大量 Token 重复使用,矩阵较大、计算密度高,计算单元容易满载。开始生成答案后,模型进入 Decode 阶段:它需要一个 Token 接一个 Token 往外生成,新 Token 依赖前面的状态,并行度下降,但模型权重依然要读取,Attention 还要不断访问此前保存的 KV Cache。两段推理使用相同的 Transformer,芯片看到的负载却差别很大——Prefill 更容易受计算能力限制,Decode 更容易卡在内存带宽和数据移动上。OpenAI 在 Jalapeño 架构说明中明确区分了这两类负载,Roofline 模型也印证了这一点:芯片实际性能约等于峰值计算能力与内存带宽乘以算术强度之间的较小值,而算术强度衡量的是搬运一份数据后能完成多少计算。
跑分一出,Reddit 用户迅速将 Jalapeño 与英伟达 Rubin 摆上擂台。有人认为它已进入 Rubin 的效率区间,单位功耗下的 Token 产出足以对标下一代旗舰;也有人泼冷水,指出测试条件、软件优化和整个平台形态尚未对齐——Jalapeño 的软件栈成熟度、互联拓扑和内存子系统与 Rubin 的完整生态相比仍有差距,现在直接分高下为时过早。争论暂时没有统一答案,但更值得关注的是,Jalapeño 并非孤例。NVIDIA 正把 Groq 3 LPU 拉进推理系统,专门处理 Token 生成;Google 也将 TPU 8 拆成偏训练和偏推理的两条路线。几家公司几乎在同一时间重新拆解芯片设计,背后逻辑已然清晰:大模型应用从训练转向持续推理与 Agent 长链路任务后,芯片效率成为数据中心的关键指标,Token 成本正在取代峰值算力,成为硬件竞争的新坐标。这场效率之争的胜负,或许要等到更多真实负载下的对比数据出炉才能见分晓。
