首页 / 资讯详情
TUM 教授 Angela Dai:放下完美数据执念,「逆向自监督」重构 3D 空间智能 | ECCV 2026
摘要
2D去噪范式在真实3D遮挡前失效,破局关键在于将物理机制转化为结构先验。 作者丨张璐 编辑丨岑峰 大模型在文本与 2D 图像上的狂飙,归功于互联网上近乎无穷的干净数据。但当 AI 试图跨越屏幕、理解真实的 3D 物理世界时,这套经验法则瞬间失效。真实扫描数据充斥着噪点与死角,物理遮挡造成的几何缺失既非随机发生,更无法用简单的去噪算法抹平。面对这一死结,多数团队选择用人工合成数据去“硬碰硬”,却始终难以跨越虚实结合的鸿沟。在 ECCV 现场,慕尼黑工业大学(TUM)Angela Dai 教授展示了一套逆转行业思路的解法:不必强行克服数据的“不完整”,把真实的物理遮挡机制,直接变成算法的结构先验。这项研究不仅打破了 3D 场景重建中困扰已久的“均值模糊”魔咒,更清晰地标定了空间智能(Spatial AI)从“静态 3D 拼图”走向“原生具身大脑”的技术演进路线。整套破局逻辑由三个层层递进的技术支柱构成:第一,将物理遮挡转化为逆向自监督(SG-NN)。团队先是将传感器的视野拆解为已知空域、已观测表面与未知盲区的三状态编码。团队摒弃对盲区的盲目强行预测,通过故意扣除观测帧构建训练对,用掩码损失(Mask Loss)让物理遮挡本身成为最天然的自监督标靶。 第二,用“几何骨架 + 2D 渲染”破解均值模糊(Seen2Scene)。面对大面积盲区带来的严重歧义,引入可见性引导的流匹配(Seen2Scene)与 3D 高斯溅射(WorldMesh)。由稳定几何提供不漂移、不坍塌的“骨架”,再借由 2D 图像先验反哺高保真“皮肉”,首次将连贯生成的尺度拉伸到了七八个房间的环境级空间。 第三,从生成反哺重构,走向机器人的“主动感知”(GenRecon):将合成场景学到的结构先验反向注入真实重构(GenRecon),更顺理成章地将物理可见性推演至具身智能领域。让 AI 不再是被动接收残缺图像的画师,而是能够预判未观测空间、自主规划最佳探路路径的空间智能体。以下为演讲全文,雷峰网AI科技评论在不改变原意的基础上,对内容进行了整理与编辑: 01数据天然“残缺”:为什么 2D 扩散范式在 3D 空间彻底失效?文本和图像生成的爆发,本质上建立在互联网海量公开数据的红利之上。无论是能侃侃而谈的大语言模型,还是瞬间绘图的生成算法,背后都有庞大的文本文献、艺术作品和照片库作为支撑。然而,当人工智能尝试踏入物理空间去生成 3D 场景时,这种基于海量数据的经验法则迅速失效了。现实环境不仅杂乱且充斥着传感器噪声,更难以克服的是物体相互遮挡带来的视角盲区。这种遮挡造成的几何缺失既非随机产生,也不符合常规的统计分布,导致在 2D 领域大获成功的“加噪-去噪”扩散范式无法直接套用。如果退而求其次使用人工构建的合成场景,模型虽然能获得完整的几何结构,却又会因为缺失现实生活的随机布局与复杂杂乱感,陷入“合成与现实”之间难以跨越的鸿沟。在最新的研讨会分享中,她给出了一个兼具工程美感与物理直觉的解法:不再强行克服数据的“不完整”,而是直接引入空间本身的物理原则,让 AI 学会利用已知的空无与遮挡关系,主动在残缺的观测中推演完整的现实。02把遮挡变先验:用“已知空无”推演未知的物理结构要打破 3D 数据采集的天然缺陷,首要突破在于将物理相机的观测机制转化为算法能理解的几何先验。当深度传感