首页 / 资讯详情
腾讯混元、清华、南洋理工联手,「以小博大」破解空间智能算力与记忆断裂难题 | ECCV 2026
摘要
Spatial-TTT 给 2B 模型装上“流式空间记忆” ,在空间基准上超越 GPT-5。 作者丨张 璐 编辑丨幸丽娟 单纯拉长上下文,可以解决“能塞进多少信息”的问题。但面对状态变化、时序关联这类长程任务时,注意力还是容易被稀释,关键证据也容易找不回来。当场景扩展到具身机器人、自动驾驶和智能硬件这些需要与三维物理世界实时交互的领域时,这一矛盾被进一步放大。与纯文本或静态图文不同,真实物理世界的输入天然是持续涌入、没有明确边界的视频流。智能体在空间中移动时,视角不断切换、物体频繁被遮挡,这些都要求系统必须具备流式空间智能——一边接收视频流,一边实时构建并更新环境的三维空间记忆。主流方案在处理这种连续视频流时,普遍在工程与架构上面临两重限制:算力与显存边界的硬性制约:基于标准 Transformer 自注意力机制的计算与 KV Cache 显存开销随序列长度呈二次方级攀升。在长达数十分钟甚至数小时的连续视频输入下,即便采用先进的长序列优化策略,端侧受限硬件也很容易因为显存急剧膨胀而无法继续运行。时序下采样对几何连续性的破坏:工程中常用的均匀抽帧或关键帧截取方案,本质上是以牺牲细粒度时序信号为代价来换取计算效率。但 3D 空间关系高度依赖连续的视差与几何线索,大幅跳帧会让模型直接漏掉关键的空间信息,而且事后很难补回来。产生这些现象的根本原因,是“推理时参数完全固定”和“物理世界持续动态变化”之间的不匹配。传统多模态模型在推理阶段所有权重都冻住了,面对源源不断涌入的视频流,只能把每一帧当成离散 Token 被动堆进上下文,缺少一套能在推理过程中实时整合、更新三维几何信息的内部记忆机制。为了解决这个问题,清华、腾讯混元、南洋理工的研究团队在最新论文《Spatial-TTT: Streaming Visual-based Spatial Intelligence with Test-Time Training》中,把重心从“继续拉长注意力窗口”转向了“在推理过程中让参数在线自适应更新”。论文链接:https://arxiv.org/pdf/2603.12255他们基于测试时训练范式,把模型的一部分参数变成可以在推理过程中动态更新的“快权重”,用它充当紧凑的非线性空间记忆。这样既能保持线性计算开销,又能让模型在源源不断的长视频中持续记住空间细节,并理解前后帧之间的位置关系。核心就是打破参数固定的限制,让模型随着视频输入实时更新自己的空间记忆(见下图1)。图1 Spatial-TTT 整体流程示意01 为什么不能全用 TTT?3:1 混合架构的取舍面对流式长视频,想把计算开销从二次方压到线性,测试时训练(TTT)提供了一种新的架构思路:打破“推理阶段参数必须完全固定”这个前提。处理连续视频时,模型会维护一组叫“快权重”的小型可更新参数?ₜ。每来一批视觉 Token,它就用自监督损失算梯度,通过在线梯度下降把当前信息写进快权重;之后需要用到历史上下文时,直接用更新后的权重做前向计算就行。快权重就成了能在线更新、压缩历史信息的动态记忆。然而,如果把多模态大模型里所有自注意力层都换成纯 TTT,性能会立刻大幅下滑。▎纯 TTT 会伤语义对齐,所以保留 25% 全注意力层预训练大模型最重要的能力之一,是已经学好的多模态图文对齐和通用逻辑推理。自注意力