首页 / 资讯详情

视频生成算力新选择:SmarCo GC3如何绕过“存储墙”这道硬门槛

雷锋网 2026-09-03 08:26 中文

摘要

大模型生成视频,正在成为这个算力饥渴时代最典型的应用场景之一。一段由AI生成的1080P视频,背后往往是数十亿参数神经网络的反复迭代,是海量张量运算在时空维度上的密集交织,也是无数像素数据在芯片与存储之间的辗转奔袭。对于大多数创作者而言,按下"生成"按钮之后等待渲染完成的焦虑,以及不断攀升的GPU集群账单,几乎已经成为一种常态。这场无声的算力战争背后,一个结构性的困境正在浮出水面——传统芯片架构下,算力的大头消耗在了"搬运"而非"计算"上。存储墙:视频生成绕不开的硬约束视频生成场景的算力特征与静态图像处理截然不同。扩散模型、视频大模型等任务不仅涉及海量张量的矩阵乘法,还涉及时序建模、多帧依赖和长序列的上下文理解。在冯·诺依曼架构的GPU上,这些运算遵循"取指-译码-执行-写回"的控制流逻辑。参数和中间特征图在显存与计算核心之间来回搬运,算完再搬回去。问题在于,这种"搬运-计算-搬运"的模式在面对视频生成这种动辄数十亿参数、长序列帧间关系的任务时,瓶颈被无限放大。4K视频每秒近2.5亿个像素数据在芯片与显存间反复搬运,大部分能耗和延迟消耗在了搬运而非实际计算上——这正是业内常说的"存储墙"。而在视频生成中,由于生成连贯动作需要多次迭代,数据搬运的开销呈指数级叠加。数据流架构:让计算跟着数据走针对这一难题,中科通量推出的SmarCo GC3芯片,提供了一种截然不同的解题思路。这款被定义为"全球首款基于RISC-V数据流架构的视频智能AIGC芯片",采用了不同于传统控制流的调度模式——没有程序计数器,没有复杂的乱序执行逻辑,取而代之的是一种基于数据依赖的动态触发机制。简单来说,当计算节点所需的输入数据齐备时,计算便自动触发;结果生成后,直接流向下一个需要它的节点。整个过程没有多余的搬进搬出,没有全局同步等待,也没有缓存未命中的随机抖动。这恰好与视频生成的内在逻辑形成了结构性的契合。以扩散式视频生成为例,其核心是带有时间依赖的降噪步骤,每一帧的生成都依赖前一步的全局张量状态,同时涉及时序注意力——这本身就是一个数据依赖图。SmarCo GC3将这张图直接映射到硬件上,中间特征图在片上计算节点间流转,直到最终生成完整帧才写出片外存储。硬参数撑起场景野心从规格来看,SmarCo GC3为视频生成场景做了相当针对性的配置。200 TOPS(INT8)的AI算力,足以支撑大规模扩散模型和视频生成模型的实时推理;128GB LPDDR5统一内存池配合ECC纠错,既保障了长视频生成任务中帧缓存的稳定性,也为每一次随机噪声采样和去噪更新提供了容错能力;而128路1080P硬解码引擎的配置,则意味着在视频生成工作流中,素材解码、预处理、AI生成和后处理可以无缝衔接,无需在多个专用芯片间倒腾数据。值得关注的是SmarCo GC3在生态层面的选择。数据流架构解决了"高效计算"的问题,但如何被广泛采用是另一个挑战。中科通量选择将数据流架构与RISC-V开放生态绑定——借助RISC-V的向量扩展和可定制指令机制,将Transformer中的矩阵乘加等高频算子固化为专用执行单元。与此同时,全球范围内越来越多的 AI 框架和算法库将原生支持 RISC-V,视频生成开发者无需从零开始。这种"数据流提供效率上限,RISC-V提供生态下限"的组合,切实降低了开发者迁移的门槛。从妥协到自由生成在传统GPU上跑视频

阅读原文(雷锋网)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。