首页 / 资讯详情

一段视频,让机器人学会开门并穿越:Video2DoorTraversal 如何打通 Real-to-Sim-to-Real

雷锋网 2026-08-28 07:24 中文

摘要

对人来说,推门近乎是一种下意识动作。对移动操作机器人来说,这是一道把感知、移动、操作和控制绑在一起的综合题。机器人需要找到并靠近把手,完成接触与旋转,在门体移动时协调底盘、机械臂和夹爪,还要避开门框、连续穿过狭窄门口。任何一步出现误差,都可能让整段任务中断。近日,由纽娲机器人、上海交通大学和山东大学研究人员共同完成的 Video2DoorTraversal 预印本公开发布。上海交通大学博士生唐心诚为第一作者, 纽娲机器人创始人、上海交通大学特聘教授杨睿刚为论文通讯作者。论文提出了一套面向轮足移动操作机器人的单视频 Real-to-Sim-to-Real 框架:用一段普通 RGB 视频重建真实门的数字孪生 DoorTwin,在仿真中生成并筛选可执行轨迹,再训练机器人完成从接近、开门到穿越的连续任务。需要说明的是,五扇门的主实验并非用一段视频训练一个策略后直接覆盖全部对象。研究针对每扇目标门分别采集一段 RGB 视频,在论文指定的轮足移动操作平台上每扇各测试 35 次,共完成 175 次测试,其中成功 169 次,平均成功率为 96.57%。在三扇结构相似、训练阶段未见过的门上,策略无需增加目标门训练或轨迹生成,零样本平均成功率为 80.95%。从接近门到完成开门和穿越,平均用时约 13 秒,视觉处理和策略推理均在机器人本地完成。一扇数字门,为什么要既“像”又“能动”真实建筑中的门并不统一。门板尺寸、铰链方向、把手形态、安装位置和开启阻力都会变化。现有相关方案可能依赖预构建门资产、额外扫描、人工任务设计或真机适配。Video2DoorTraversal 试图减少其中一部分前置工作。Video2DoorTraversal 的第一步,是把真实门转化为可直接进入物理仿真的 DoorTwin。系统从单段 RGB 视频中恢复带真实尺度的几何信息和相机运动,识别门板、把手及铰链关系,生成包含关节、碰撞几何和外观纹理的数字资产。随后,系统从参考视角检查轮廓、比例、把手类型、铰链方向和部件位置,并持续修正生成结果。数字门既要在视觉上接近真实对象,也要在物理上能够被抓住、转动和推开。只有满足这两个条件,机器人在仿真中的练习才可能迁移到真机。把现场试错,转移到仿真环境完成 DoorTwin 后,论文中的仿真闭环代理会把任务组织为接近、抓取、转动把手、推门和穿越等参数化技能,并在模拟器中反复执行。一条轨迹失败后,系统会根据碰撞、接触、把手旋转和门体开启状态分析原因,在邻近参数中继续搜索。只有通过任务、碰撞和运动学验证的成功轨迹,才会被保留为训练数据。这个过程不依赖针对每扇门进行真人遥操作采集。为了提高从仿真到现实的适应能力,训练还随机改变机器人与门的初始位姿、铰链和把手的摩擦与阻尼、开门阻力和相机外参,并加入多种深度噪声。这些扰动和边界情况可以在仿真中反复验证,论文只保留在扰动下仍然成功的轨迹作为策略训练数据。这里存在两个不同的输入阶段:开头的一段 RGB 视频用于生成 DoorTwin;真机执行时,ArticuACT 使用机器人前视和腕部的双视角深度图以及机器人状态,协同输出底盘、机械臂和夹爪命令。模型训练时还会预测接触、把手转动和门体开启进度,以学习任务不同阶段的交互特征。96.57% 与 80.95%,分别说明什么96.57% 对应论文设置下五扇真实推门的平均真机结果,表明该框架在论文限定的对象、轮足平台和测试设置下完成了端到端真机验证。这一数字不代表通用开门产品或纽娲公司级工程闭环已经得到验证。80.95% 则对应结构相似未见门上的零样本测试。策略从一扇重建门的仿

阅读原文(雷锋网)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。