首页 / 资讯详情
英伟达Vera Rubin的Agent吞吐暴涨最高提升30倍,却不只靠GPU | Hot Chips 2026
摘要
在Agent推理上,英伟达又把性能往前推了一大步。Hot Chips 2026期间,英伟达披露了Vera Rubin NVL72最新Agent工作负载测试结果:在DeepSeek V4-Pro、单用户每秒160 Token的测试条件下,相比GB300 NVL72,每兆瓦吞吐最高提升30倍。 但比30倍更值得关注的是,英伟达这次提升Agent推理效率,已经不再只依赖一颗更快的GPU。 面对长上下文、低延迟Token生成、工具调用和数据交互同时出现的Agent工作负载,英伟达正在把一次推理拆成不同类型的计算任务:Vera Rubin NVL72承担大规模模型计算,Groq 3 LPX专攻低延迟Token生成,Vera CPU处理工具编排、代码执行和数据处理,Spectrum-X则负责把这些计算、数据和存储资源连接起来。 换句话说,Agent工作负载让性能问题不再停留在一次模型计算内部,而是沿着上下文、生成、工具执行和基础设施访问继续向外扩展。从GPU、CPU到专用推理芯片和网络,英伟达在Hot Chips展示的已经不只是一代芯片的性能提升,而是一套针对Agent工作负载重新划分计算边界的系统架构。超长上下文实测,Rubin把Agent推理拉进真实长任务这次Hot Chips上,英伟达给出了一组更贴近Agent工作流的Rubin实测数据。英伟达此次测试采用SemiAnalysis AgentX工作负载。AgentX基于真实Agent编程会话的流量轨迹,在去除原始 prompt、代码、工具参数和结果后,保留请求长度、上下文增长、工具暂停、子任务依赖和时序等负载特征。此次测试的中位输入上下文超过 14 万 Token。按照英伟达测得、目前仍待SemiAnalysis审核的结果,在DeepSeek V4-Pro工作负载、单用户每秒160 Token的交互速度下,Vera Rubin NVL72相较GB300 NVL72最高实现30倍的每兆瓦吞吐。Vera Rubin 在 160 交互性下,每兆瓦的吞吐量提高了 30 倍。(图源:英伟达技术博客)英伟达HPC与AI超大规模基础设施解决方案高级总监Dion Harris指出,传统推理基准通常围绕“单一、可预测的请求”设计:输入和输出相对确定,因此可以比较Token生成速度、吞吐量等指标。但Agent任务会跨越多轮操作,而且每一步的工作负载都可能变化。Harris续指,传统推理负载可以使用8K甚至32K的输入序列进行测试,但到了递归式、多轮Agent任务中,Prefill需要处理的上下文会随着每一次迭代持续增长,因此平台评估需要开始考虑数十万Token级别的输入。 原因在于,Agent完成一项任务时,模型可能不断读取文件、调用工具、执行代码,再把新的结果写回上下文,进入下一轮推理。AgentX 测的是推理服务基础设施面对 Agent 流量形态时的表现,不是测 Agent 任务完成质量。 这也是此次Rubin测试采用超过14万Token上下文的意义。换言之,14万Token的意义并不只是“输入更长”,而是测试对象开始从静态prompt转向动态任务轨迹。它试图回答的不再只是“一次模型推理能够跑多快”,而是在更接近Agent实际运行轨迹的长链路负载下,系统还能维持怎样的性能。与此同时,英伟达把两个指标放在了同一张性能曲线上:横轴是单个用户每秒获得的Token数量,即交互速度;纵轴则是固定电力预算下整套系统能够处理的Token数量,即每兆瓦吞吐。在多轮代理会话中,每轮对话所包含的上下文信息稳步增加。(图源:英伟达技术博客)