首页 / 资讯详情

从单卡到千卡互联,平头哥真武 V900 背后的 AI 算力变局

极客公园 2026-09-23 05:55 中文

摘要

作者|Cynthia 编辑|郑玄 9 月 22 日的 2026 杭州云栖大会,平头哥少见地被完整推到了主论坛台前。 当天上午,吴泳铭完成主旨演讲后,千问大模型、多模态模型负责人依次登场,随后就是平头哥副总裁高慧。她的演讲题目是「Agentic 时代卓越算力基石」。 平头哥带来的产品,则从一颗最新得真武 V900 芯片,一直延伸到 ICN Switch 互联芯片、磐脉智能网卡、镇岳 SSD 主控、倚天 CPU 路线图,以及下一步的算、存、网全栈协同的超节点服务器。 发布「产品全家桶」地背后,是 Agentic 时代的负载变化:算力需求已经从训练为主进一步走向推理增长,应用从单轮请求变成连续的多步任务, 硬件的竞争也从一颗芯片的指标扩展到整个计算系统的协同。 01 真武V900,平头哥最新一代AI训推芯片 这次发布里,平头哥新一代训推一体 AI 芯片真武 V900 仍然是分量最重的产品。 这颗芯片搭载 216GB 显存,片间互联带宽达到 1200GB/s,单芯片性能是上一代真武 M890 的 3 倍, 是目前中国算力性能最强的 AI 芯片。精度上, 该芯片原生支持 FP8 和 FP4,可覆盖高精度训练以及低精度、超低精度推理。 按照平头哥公布的计划,V900 将在 2027 年第一季度进入量产销售。此后,2028 年 Q3,真武 J900 也将正式推出。 而此时,离上一代真武发布,其实只过去了几个月。2026 年 5 月,平头哥 M890 首次亮相。这颗芯片拥有 144GB 显存和 800GB/s 片间互联带宽,性能达到上一代 810E 的 3 倍,并支持从 FP32 到 FP4 的多种数据精度。到了 V900,性能再次提升 3 倍,显存从 144GB 增加到 216GB,互联带宽也从 800GB/s 提高到 1200GB/s。 再向前看一代,2024 年的真武 810E 也已经从早期的单一推理芯片走向训推一体,采用自研并行计算架构和互联技术,并配套 SAIL 软件栈。 810E、M890、V900 连续三代产品里,平头哥一直在同时提高训练、推理、显存和低精度计算等核心能力。 而背后的关键词,则始终围绕 AI 时代工作负载的变化。 举个简单的例子,模型进入万亿参数以后,MoE 几乎成为了默认的架构选择。 如果一个几万亿参数的模型每次推理都让全部参数参与计算,算力消耗和推理成本都会迅速上升。因此,MoE 会把模型拆成大量专家,每个 Token 只调用其中一部分,在继续扩大模型容量的同时,把一次实际参与计算的参数量压下来。 这种架构缓解了计算量,却同时把硬件压力推向了三个方向。 首先是算力。 MoE 减少了每次参与计算的参数量,但每个子专家的参数量仍在几十万级别,Token 也依然要在很短时间内完成大量矩阵运算;进入训练阶段以后,还有反向传播、梯度更新等更重的计算。大模型参数扩张后,AI 芯片的计算性能必须同步增加。这也是平头哥过去几代真武芯片一直在提升的能力 算力之外,模型进入万亿参数规模后,显存也会成为新的重点。 单颗 M890 有 144GB 显存,真武 V900 则进一步提升至 216GB。如此一来,只需 10 多张真武 V900,即可部署一个万亿规模的大模型。 据悉,基于真武 M890 的超节点已大规模应用,并跑通了 Qwen3.8、Kimi K3 等超 2 万亿参数规模模型,让数万亿参数模型的专家并行尽量在一个超节点内部完成。 但只有算力与显存还不够, 面对数万亿参数规模的模型,任何一颗单芯片的显存容量都显然不够。因此,模型在部署实际时

阅读原文(极客公园)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。