首页 / 资讯详情
Jalapeño 跑分炸场,GPU 推理路线开始分裂?
摘要
Token 成本成为大模型硬件竞争的新坐标。 作者丨郑佳美 编辑丨岑 峰 今天,OpenAI 的自研推理芯片 Jalapeño,终于从规格表走到了跑分台。这次公开的数据很接地气:Token 吞吐、生成延迟、单位功耗下能跑多少推理。因为大模型上线以后,芯片面对的早就不只是一次训练任务。ChatGPT 要一直回消息,Reasoning 模型要持续生成长链路内容,Agent 还会一轮接一轮调用模型。算力再高,Token 吐得慢、延迟压不下来、功耗又高,数据中心照样难受。成绩一出来,Reddit 很快就把 Jalapeño 和 NVIDIA Rubin 摆到了一起。有人认为它已经进入 Rubin 的效率区间,也有人认为测试条件、软件优化和整个平台形态没有对齐,现在还没法直接分高下。争论暂时停在这里,没有统一答案。更巧的是,Jalapeño 并不是孤例。NVIDIA 正在把 Groq 3 LPU 拉进推理系统,专门处理 Token 生成;Google 也把 TPU 8 拆成偏训练和偏推理的两条路线。几家公司几乎在同一时间开始重新拆芯片的工作,背后那套硬件逻辑难道真的已经变了吗?01Jalapeño 在看 Token 怎么跑OpenAI 公布的数据里,Jalapeño 在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上,峰值吞吐位置每瓦完成的 AI 工作提高约 1.5~1.9 倍,端到端延迟降低约 1.7~3.6 倍;在交互速度要求较高的区间,性能提升达到约 2.1~4.1 倍。芯片额定功耗是 700W,这批负载中的持续功耗没有超过 550W。雷峰网这些数字为什么围绕 Token 展开,需要先看一次大模型推理内部发生了什么。输入 Prompt 时,模型进入 Prefill。假设一次输入 8K Token,这些 Token 可以大规模并行计算,模型权重从 HBM 取出来之后,会被很多 Token 重复使用。此时矩阵比较大,计算密度高,矩阵计算单元很容易忙起来。开始生成答案后,模型进入 Decode。它需要一个 Token 接一个 Token 往外生成,新 Token 又依赖前面的状态。并行度下降了,模型权重却依然要读,Attention 还要不断访问此前保存下来的 KV Cache。所以两段推理看起来使用相同的 Transformer,芯片看到的负载却差别很大:Prefill 更容易受到计算能力限制,Decode 更容易卡在内存带宽和数据移动上。OpenAI 在 Jalapeño 的架构说明里也明确把两者做了这一区分。雷峰网用 Roofline 模型可以把这个问题看得更清楚。芯片能发挥多少性能,大致取决于两个上限:可达性能 ≈ min(峰值计算能力,内存带宽 × 算术强度)算术强度说的是,搬运一份数据以后,能拿它做多少计算。训练和 Prefill 的矩阵足够大,一次读取权重能够服务大量 Token,所以算术强度很高。低 Batch Decode 里,情况会反过来。假设 Dense 模型有 P 个参数,每个参数平均占 b Byte,生成一个 Token 涉及约 2P FLOPs 量级的矩阵运算,而读取一遍权重需要约 P × b Byte,只考虑权重部分,算术强度粗略只有:2 / b FLOPs/Byt