首页 / 资讯详情
7 篇 ECCV 论文!极佳视界联合顶尖高校,打通空间智能从「看得稳」到「摸得准」再到「决策灵」的落地瓶颈
摘要
以推理决策与物理重建,让空间智能从生成走向因果交互。 作者丨张 璐 编辑丨幸丽娟 在生成式 AI 的演进历程中,从二维像素走向三维物理世界,是人工智能迈向现实落地的必经之路。以 3D Gaussian Splatting、Sora 级视频生成以及多模态大模型为代表的技术,曾让行业看到了空间智能的巨大潜力。然而,当这些原本运行在数字世界中的算法尝试走向真实硬件与物理场景时,整个行业正在遭遇一场前所未有的“落地阵痛”。当前的视觉与空间模型看似绚丽,却普遍陷入了三重难以逾越的瓶颈:决策依赖暗盒式的直接预测,缺乏对物理因果的常识推理;三维资产仅停留于视觉逼真,剥离了质量与形变等物理属性;世界模型缺乏对动作控制的精确响应,沦为无法评估安全的离线画面。缺乏逻辑推理、缺乏真实物理属性、缺乏控制闭环,这三大软肋直接阻断了物理 AI从实验室 Demo 迈向工业落地的可能。突破这些瓶颈的关键,不再是单一模型参数的堆叠,而是要建立一套贯穿“空间感知、物理推演到具身决策”的技术演进图谱。在本届计算机视觉顶级学术会议 ECCV 上,极佳视界(GigaAI)展现出了极其瞩目的学术爆发力,共有 13 篇论文成功入选。其中,有 7篇落在了空间智能这个研究方向。极佳视界联合清华大学、中国科学院自动化研究所、浙江大学、上海交通大学等顶尖学术机构,将这 7 项重磅研究汇聚成了一套完整的技术破局方案。不同于零散的学术试验,这一系列成果展示出了一条极其清晰的技术演进路径:物理 AI 的终局,不仅是生成逼真的画面,而是打造能够理解物理规律、预测未来演化、并与真实世界无缝交互的具身大脑。01打破暗盒与离线,重构具身大脑与试车场在传统的具身智能与自动驾驶开发中,模型大多扮演着一个“暗盒”角色:输入传感器图像与自然语言指令,通过端到端神经网络直接预测并输出末端执行器的动作坐标或车辆轨迹。 这种“图像进,动作出”的暗盒模仿范式,在环境简单、分布内的数据集上或许能跑出不错的成功率。然而,一旦面对真实世界中复杂的物体遮挡、未见过的物品样式、随机的动态扰动以及长程多步骤任务时,暗盒模型就会暴露出致命的缺陷:它无法解释自己“为什么这么做”,也无法在遇到偏差时进行自我修正。 极佳视界的破局思路很明确:把“思维链推理”与“强化学习”深度融入决策闭环。无论是微观的桌面操控,还是宏观的道路驾驶,都打造出了可落地的技术标杆。▎从暗盒操控到显式推理:VLA-R1 将 R1 强化学习引入具身决策论文:VLA-R1:Enhancing Reasoning in Vision-Language-Action Models合作机构:极佳视界 × 中国科学院自动化研究所 × 清华大学论文链接:https://arxiv.org/abs/2510.01623传统的具身操控大多依赖暗盒式的模仿学习,试图直接从像素跳跃到末端执行器的控制坐标。这种跳过逻辑推导的直觉反应,在面对遮挡、复杂常识与多目标干扰时极易失效。要打破这种局限,关键在于赋予模型像人类一样“先推理、后动手”的能力。极佳视界联合中科院自动化所、清华大学打造的 VLA-R1 框架,首次将类似 DeepSeek-R1 的强化学习(RL)与显式思维链(CoT)深度融入具身操控中。VLA-R1 整体训练框架:结合 SFT 显式思维链推理与 GRPO 强化学习