首页 / 资讯详情

几何的「反攻」!港科大谭平:从局部先验到全局一致,3D 几何如何增强视觉大模型 | ECCV 2026

雷锋网 2026-09-17 03:20 中文

摘要

学习模型已经具备很强的局部视觉先验,而 3D 几何可以帮助建立跨视角、长距离的全局一致性。二者如何结合,是 3D 视觉与空间智能中的重要问题。 编辑丨岑峰 在生成式 AI 的快速发展中,Sora 等视频和图像扩散模型(Diffusion Models)展示了很强的视觉生成能力。大规模 2D 数据让模型学到了丰富的视觉与语义先验,在单帧和局部视频生成上取得了显著进展。但当任务进一步要求多视角、长距离的 3D 一致性时,仅依赖数据驱动的局部先验仍会遇到挑战。与此同时,在 3D 视觉和场景生成中,一个长期问题是如何把局部生成结果组织成全局一致的 3D 世界。现有视觉大模型在某些场景中仍可能出现跨视角结构不一致、物体数量或布局不合理等现象。例如,当提示词中出现“卧室”时,模型有时会生成多张床;当虚拟相机在生成场景中进行较长距离漫游时,也可能出现建筑结构逐渐扭曲等问题。这些现象说明,模型从数据中学到的局部先验非常强,但对全局 3D 结构的约束仍然不足。引入显式的 3D 几何,可以为这些局部预测提供跨视角的结构约束,帮助构建更一致的全局结果。在今年的欧洲计算机视觉国际会议(ECCV)上,香港科技大学教授谭平围绕这一问题介绍了团队近期在 3D 重建与 3D 场景生成方面的工作:学习方法提供强大的局部先验,3D 几何则用于组织和约束这些预测,从而提升大规模场景中的全局一致性与可扩展性。谭平师从国际 3D 视觉泰斗权龙教授,长期从事 3D 视觉研究。本次演讲延续了这一方向,重点讨论如何把学习方法的表达能力与多视图几何、全局优化等经典 3D 方法结合起来。在演讲中,谭平教授将 3D 重建与 3D 场景生成放在同一框架下讨论:无论是从图像重建 3D 世界,还是生成可漫游的 3D 场景,学习模型已经能够提供非常强的局部先验;而要把这些局部结果组织成全局一致的 3D 表示,几何结构与全局优化仍然具有重要作用。在重建任务中,前馈网络高效且鲁棒,但在大规模输入和高精度位姿估计上仍有计算与一致性问题;团队借鉴视觉 SLAM/SfM 的关键帧思想,并结合集束调整(Bundle Adjustment)进行全局优化。在生成任务中,则通过显式 3D 布局或 3D 代理(Proxy)提供结构约束,再利用生成模型补充外观与细节,从而改善大场景漫游时的空间一致性。这场演讲想强调的并不是学习方法与几何方法的二选一,而是二者的互补性:学习模型擅长从大规模数据中获得强大的局部先验,3D 几何则为跨视角、长距离场景提供全局结构约束。对于空间计算、世界模型和具身智能,这种“学习先验 + 几何约束”的结合值得进一步探索。以下是谭平教授的演讲分享,AI科技评论根据其英文演讲内容进行了不改原意的编辑:▎演讲标题:《几何的反攻:规模化 3D 重建与结构化 3D 场景生成》(Geometry Strikes Back: Scaling 3D Reconstruction and Structuring 3D Scene Generation)演讲者: 香港科技大学 谭平今天我将分享我们近期在 3D 视觉和 3D 场景生成方面的工作。近年来,以 VGGSfM(或 DUSt3R 类前馈网络)为代表的基于大型 Transformer 的方法取得了很大进展。这类方法的基本思路非常直观:接收一组输入图像,提取特征,

阅读原文(雷锋网)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。