首页 / 资讯详情

ECCV 2026 专访:让大模型「忘掉XYZ」,RoboTracer 用 3D 空间感知与度量推理重塑机器人轨迹追踪

雷锋网 2026-09-09 02:32 中文

摘要

用像素坐标加绝对深度表示轨迹,换本体不必重训模型。 作者丨张 璐 编辑丨幸丽娟 试想,对一个家庭服务机器人下达指令:拿水壶从左到右依次给花浇水,喷头需悬停在每朵花上方 1 到 5 厘米处。这个指令看似日常,对现在的具身系统却很苛刻:既要分清花的左右顺序,又要把喷头停在每朵花上方约 1–5 厘米。2D 轨迹一旦深度估错,喷头要么砸到花盆,要么对着空气做无用功。带绝对尺度和避障约束的指令,是当前系统的常见短板。一方面,端到端的视觉-语言-动作模型 (VLA) 可以直接输出动作,但真机示教成本高,换物体、换距离后容易失效。另一方面,通用视觉语言模型(VLM)的 2D 理解能力强,却缺少绝对尺度和深度感知,2D 轨迹抬到 3D 后容易悬空或碰撞。前者的问题在于视觉到动作的映射缺乏显式空间表征,场景稍有变化便需重新采集示教数据;后者则根本不知道“1厘米”在三维空间里意味着什么。在团队先前的探索中,模型已能预测目标物体的 2D 坐标点,但面对“按顺序浇花”、“悬空避障”这类涉及连续时序与三维几何的场景,单个 2D 点根本无法支撑起复杂的物理交互。 北航、北大、智源、中科院自动化所等团队的选择是:不让大模型直接猜关节力矩,而让 VLM 把指令拆成一条带物理尺度的多步 3D 轨迹,再交给运动规划器执行。论文链接:https://arxiv.org/pdf/2512.13660他们提出 RoboTracer,以及约 450 万样本、3000 万问答对的 TraceSpatial。轨迹用图像坐标加度量深度(u, v, d)表示,不绑定特定本体,同一套模型可接到 UR5 与 Unitree G1。AI 科技评论采访到了论文核心作者周恩申。他是北京航空航天大学软件学院博士生,并拥有上海人工智能实验室、银河通用及智源研究院等多家具身智能顶尖机构的研究经历。作为 RoboBrain 系列项目(从 1.0 到 2.5)的深度参与者,他不仅还原了团队用纯文本 Loss 监督 3D 尺度时的反直觉发现,也客观剖析了纯视觉轨迹在物理力控上的局限,并分享了他对具身智能从“被动感知”迈向“主动感知”的前瞻思考。接下来,本文将从表征表达、绝对尺度注入以及过程奖励机制三个维度,拆解 RoboTracer 如何破局 3D 空间推理。 01大模型为什么总在3D空间里“犯路痴”?要让 VLM 从 2D 图像走到 3D 交互,至少要同时做两件事:3D 空间指称(物体在哪、和谁相关),以及 3D 尺度度量(实际有多远、多高)。二者在模型中彼此耦合。下面我们从三个角度分析:空间点怎么表示、尺度怎么监督、多步推理怎么打分。空间指称、尺度度量与轨迹生成流程示意图▎忘掉XYZ,用“像素坐标+绝对深度”走捷径一种直观的思路,是让大模型直接输出物体在相机/世界坐标系下的绝对三维坐标 (x, y, z)。但这条路在实践中极其艰难。通用 VLM 面对的大量互联网数据天然缺乏 3D 标注,直接预测 XYZ 意味着模型不仅要同时学准三个维度的绝对物理数值,还得在内部硬学复杂的相机内外参,极易导致训练不稳定和几何畸变。RoboTracer 提出了另一种解法:把关键点拆解为图像坐标 (u, v) 加上绝对度量深度 d。前两维 (u, v) 是二维图片坐标,与海量互联网 2D 图文数据天然兼容,甚至可以直接

阅读原文(雷锋网)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。