首页 / 资讯详情
NUS Show Lab 寿政教授:打通自回归与离散扩散,打造下一代具身大模型底座|ECCV 2026
摘要
告别模型拼贴套路,自回归与离散扩散的融合,正在开启 AI 的体验时代。 作者丨张璐 编辑丨岑峰 “理解”和“生成”真的无法在同一个模型底座中完美融合吗?不同于拼接独立模型的传统做法,NUS Show Lab 选择了一条更原生的架构路线:在单个 Transformer 中同时打通自回归预测与离散扩散生成。作为多模态领域的重磅成果,Show-o 系列不仅打破了模态壁垒,更将触角延伸至具身机器人决策。在 ECCV 2026 现场,Show Lab 负责人寿政教授详细还原了他们如何用闭环算法破解数据稀缺、消除连续视频帧卡顿,并实现云端大模型与端侧低延迟控制的完美配合。寿政教授此次披露的研究成果,不仅是一次性能的跨越,更是多模态架构从“实验玩具”向“具身大脑”进化的分水岭。其核心突破点在于以下三个维度的重构:首先,在架构底层,Showo 架构打破了文本离散性与视觉连续性的“死结”。通过将处理文本的自回归(AR)机制与处理视觉的离散掩码扩散(Discrete Diffusion)深度缝合,Showo 避开了传统自回归生成图像的效率泥潭,同时也解决了连续扩散模型无法直连 VLM 离散 Token 的痛点,实现了逻辑推理与高质生成的完美共生。其次,针对困扰具身智能的“标注荒”,寿教授提出的循环一致性监督(Cycle Consistency)提供了极佳的解决方案。在缺乏人类标注的特定文化或低资源领域,模型通过“观察-描述-再合成”的逻辑循环实现自监督进化。这让 AI 从 YouTube 海量无标签“生肉”视频中吸取物理常识成为了可能,极大地拓宽了 Scaling Law 的数据边界。最后,具身智能的落地成败取决于毫秒级的反应。团队自研的 Q1 实时骨干网,通过精密的特征对齐与蒸馏,实现了远超前沿闭源大模型的推理速度。这证明了:一个真正的“数字生命”大脑,不仅要能深思熟虑,更要在与物理世界碰撞的一瞬间,给出近乎本能的实时反馈。以下为演讲全文,雷峰网AI科技评论在不改变原意的基础上,对内容进行了整理与编辑:01告别“只读不练”:多模态 AI 如何从“看懂视频”跨入“具身体验”?过去几年,视觉与语言交叉领域的核心任务主要围绕视频理解与视频生成两条独立路线展开。前者致力于将视频转化为文本描述或解答视频问题,后者则根据文本提示词生成对应的动态视频。以往业界往往为这两类任务分别训练专属模型,但一个天然的演进趋势是:能否构建一个单一的统一模型来同时完成这两类任务?如今,AI 发展正迎来一个关键转折点,即从单纯的“语言-视频相互作用”迈入“体验时代”。在这一新阶段,模型不再仅仅停留在对视觉和文本的关联认知上,而是融入了“动作”维度。模型需要具备在物理或虚拟环境中采取行动的能力,并通过环境给出的实时反馈实现“在做中学”。02Show-o 架构突破:用单个 Transformer 打通“文本生成”与“高效绘图”在实现多模态统一的探索中,业内曾出现过不同的技术尝试。例如早期的NEXt-GPT项目,通过将大语言模型与专用的扩散模型进行外挂组合,实现了任意模态到任意模态(Any-to-Any)的输入与输出。但这本质上依然是“大模型 + 独立生成模块”的分立架构,并未实现模型底座的真正融合。要用单一网络同时搞定理解与生成,主要面临两套主流范式的权衡。▎纯自回归范式以 Chamel