首页 / 资讯详情
深度解读:智谱为什么要在 Infra 层搞 RSI?
摘要
电话会揭秘智谱策略,以递归式优化跑赢300亿算力成本战。 作者丨高允毅 编辑丨岑 峰 9月17日,唐杰罕见的发了一条长推,这次他聊的是最近最火的话题之一:RSI。智谱也在暗暗发力RSI,他们已经把RSI放到了Infra层面,做出一套由GLM-5.3驱动的推理基础设施。正是这套Infra系统,让 GLM-5.3-Flash,即前段时间火遍全球的匿名模型 Ox-Alpha,在发布一周内,就迅速成为了全网使用最广泛的模型之一,短短六天内处理了超过 62万亿个 Token。更具有里程碑意义的是,这一切,全是在十万张国产芯片上跑出来的。要知道,我们过去一直难以摆脱对英伟达的依赖,正在于国产芯片底层软件生态的薄弱,这中间有无数难以想象的算子兼容与通信难题。再加十万张芯片这个量级,难度是呈指数级上升的,在这样的集群里,每天都可能有几百张卡发生硬件故障、网络掉线或数据丢包。而唐杰透露,从第一次全量跑通到把全部的真实生产流量切过去,智谱居然只用了短短两周。这在以往,需要一支经验丰富的基础设施工程师团队花费数周甚至数月才能完成。面对硬件生态的不完美,智谱用软件给硬件“打补丁”并做到了极致优化。不仅让大模型顺利跑通,更使端到端吞吐量直接提升了 3.2 倍。这背后体现了智谱的一个核心判断:在算力受到外部严格限制的情况下,中国 AGI 能否取得突破,关键除了拥有多少芯片,而在于能否通过软件更高效地调动和利用算力。智谱此举,实质上是希望借助 RSI 建立一种“底层解耦”的能力,使 AI 能够自主适配不同硬件生态,跨越硬件之间的兼容障碍。也就是说,智谱正试图把“国产算力不好用”这一行业难题,转变为“由 AI 自动挖掘硬件极限”的技术主动权。国产芯片集群、由 AI 深度参与的 Infra 系统、全球出圈模型,这三件事组合在一起,连唐杰忍不住感慨:我们距离RSI的终局还相差甚远,但那个 “模型优化系统、系统反哺模型” 的最小循环,已经真实地转动了起来。01十万张国产芯片集群:一场没有参考答案的部署硬仗唐杰表示要在十万张国产芯片,把一个大模型真正跑通、部署好,这并非易事。这个事至少有三个坎,每个都足以拖垮一支经验丰富的工程团队。首先,国产芯片的内存和数据传输速度天生就有限,不能直接照搬英伟达那套成熟经验。其次是软件栈极不成熟,很多底层组件缺失。这里缺乏现成的运维手册,很多关键算子没有现成实现,大量底层文档甚至常常只能靠“猜”去推测和验证。此外,还要考虑模型本身的负载极限。GLM-5.3-Flash 是全新架构,既要同时处理文字和图像,还要处理 100 万 token 的超长上下文。这意味着 KV 缓存的容量压力会呈几何级暴涨。智谱的解法是用 GLM-5.3 驱动的Infra Agent,把几个关键技术融合一处,用软件工程能力补硬件短板。比如,用通信换内存。采用“节点内张量并行”与“层分割”,把模型按层拆分,同时在单个服务器内让多张芯片共同分担最核心的注意力和输出计算。用计算换内存。开启 ReplaySSM 策略,内存装不下时先把数据丢掉,等用到的时候再让芯片当场现算,用极短的计算时间换取宝贵的内存空间。用精度换容量。采用 W8A8 量化,把模型权重和激活都压缩到 8 位,直接砍掉一半以上的存储和带宽占用;再把最占空间的 KV 缓存,根据数据重要程度混用 INT8、F