首页 / 资讯详情
打破黑盒猜想:大模型通往真正「空间智能」的破局之路
摘要
给模型做一次脑部“CT”,低成本重塑真实空间智能。 作者丨张 璐 编辑丨幸丽娟 先来看一道简单的多模态大模型视觉考题:观察给出的几张室内多视角照片,请回答:从图 1 的视角来看,蓝色椅面的办公椅右边是什么?A. 单人沙发以及旁边的一张小桌子B. 摆着微波炉的桌子C. 小厨房D. 蓝色垃圾桶Qwen2.5-VL-7B精准选择了正确答案 A;LLaVA-OneVision-8B却选了 D。按照以往的习惯,我们大概率会把原因归咎于模型在做多视角坐标转换时逻辑迷航了,或者它的空间推理能力不够,把左右相对位置搞混了。但中山大学团队却在论文《SpatialSV: Internalizing Interpretable 3D Spatial Awareness in MLLMs via Task-Oriented Visual Supervision》中,给出了一个意想不到的答案。研究团队像给模型做脑部 CT 诊断一样,提取出 LLaVA 在推理生成时的中间隐藏层特征,渲染成了一张 3D 空间点云图。 瞬间真相大白:在 LLaVA 脑海里建构的三维几何画卷中,那张作为关键参照物的“小桌子”,压根就没有被建模出来。这项工作的核心价值,在于它打破了这种“黑盒猜想”。它用这套2D-to-3D 几何重建机制,不仅把大模型的视觉盲区看得清清楚楚,更找到了一条利用开源 3D 模型自动生成监督、砍掉 50% 人工文本标注的高性价比训练路线。01 内部直接还原 3D 空间: 训练时注入几何约束,推理时零延迟卸载过去赋予多模态大模型 3D 感知能力,主要有两条路线:一是推理阶段接入外部深度模型,但这会显著增加推理延迟,且外部工具的误差容易传导至大模型;二是蒸馏 3D 基础模型的隐特征,但这种特征层面的对齐缺乏显式几何约束,且内部学习到的表征难以解释。SpatialSV 的做法,是让模型在中间隐藏层直接将 2D 视觉特征提升(Lifting)为显式的 3D 几何表达。SpatialSV 整体架构示意图为了兼顾低阶几何细节与高阶跨模态语义,框架从大模型的中间隐藏层(以 Qwen2.5-VL 为例,选取第 4、12、20、28 层)提取特征,并映射到统一的三维特征空间中。随后,解耦的轻量化 DPT 模块会接管这套特征,同步预测三项在几何上互为补充的显式表征。首先是深度图的预测,主要用于确定场景中各物体的空间距离与前后层次,并通过引入梯度 Loss 专门抑制边缘模糊,保持物体的轮廓清晰。其次是射线图。传统方法如果直接让模型预测相机的三维旋转矩阵,往往会因为矩阵的正交性约束导致优化不稳定;SpatialSV 转而预测每个像素的射线起点与方向,用这种更平滑的方式隐式建模相机位姿与观察视角,降低了学习难度。最后是点云图,用来还原每个像素在三维物理世界中的真实空间坐标,并配合法向量 Loss 来约束几何表面的平整度与法向一致性。深度、位姿与点云三者相互配合,共同在模型隐藏层内构建起一套严密的三维物理拓扑。这些 3D 预测头与几何 Loss 仅在训练阶段参与优化,目的是将三维空间约束融入模型主干参数。进入推理阶段后,所有的 2D-to-3D 投影层与 DPT 预测头会被直接卸载。模型无需调用外部工具,也不产生额外的推理延迟,完全依靠内部形成的空间表征完成回答。02脑内点云当“C