首页 / 资讯详情
把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?
摘要
Gemini 领跑,GPT表现平平,国立清华、英伟达提出双奖励孪生网络,告别算力焦虑。 作者丨张 璐 编辑丨幸丽娟 VLM大模型(VLM)在静态视觉与推理任务上已展现出强悍能力。然而在具身智能领域,当模型需要面对复杂的动态交互与机械臂控制时,它们能否准确评估智能体的动作与画面变化,依然是一个待检验的问题。过去不少人以为,能“看懂画面”就意味着能“当好教练”。但对具身智能来说,从识别场景到精准评估动作进展,完全是两码事。为了厘清各大模型在真实动作评估中的底细,国立清华大学与 NVIDIA 联合团队在最新研究《VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning》中,把 Gemini 2.0、GPT-4.1 等主流大模型拉进同一个考场,对它们的视觉裁决能力做了一场综合评估。论文链接:https://arxiv.org/pdf/2607.0048301考场设计:四大仿真套件、10 大场景与“看图判进展”规则研究团队选用的 10 个典型任务,涵盖了具身智能的四大主流仿真套件。其中既有 Cart Pole(倒立摆平衡)这类考察基础刚体平衡控制的任务;也包含了 Straighten Rope(拉直绳索)与 Pass Water(平移水杯),这类专门考察模型对非刚体形变与连续流体微观感知能力的柔体操作。研究所选用的 10 大典型具身智能任务场景此外,任务库还涵盖了 Soccer(踢球入网)、Sweep Into(扫方块入洞)和 Open Drawer(拉开抽屉),这类任务考察的是模型对三维空间中机械臂末端与物理接触关系的精准理解;以及《我的世界》中的 Combat Spider(击杀蜘蛛)、Milk Cow(挤牛奶)、Shear Sheep(剪羊毛)和 Hunt Cow(追逐猎牛),这类任务考察的则是模型在复杂视角下,进行长时程、多步骤逻辑规划的综合能力。在这场测试中,研究团队剥离了游戏或物理引擎内部的“上帝视角数据”(比如物体的精确三维坐标、速度等)。大模型只能像人类玩家一样,接收第一人称 RGB 视觉画面以及一句简单的自然语言任务目标。从智能体的探索轨迹中随机采样出前后两个时刻的观察画面,连同任务文本提示词一同喂给冻结参数的VLM。大模型需要做出判断:画面 1 和画面 2 相比,哪一个画面代表智能体离任务目标更近?为了保证评测的客观性,研究团队为每个任务都精心准备了 100 对包含伪真值的对照画面组,用来直接衡量各大 VLM 在具身场景下的偏好判断准确率。比赛规则已经明确,接下来就是各大主流 VLM 登场硬碰硬的时刻了。02横向实测:Gemini 综合最稳,开源小模型局部反超当这批十项具身考核任务布置下去后,各大VLM表现出来的差异之大,远超预期。各大主流VLM在 10 项具身任务中的进展预测准确率▎综合领跑:Gemini-2.0-Flash 准确率全线突破 70%在这场具身感知大打擂中,Gemini-2.0-Flash 展现出了极佳的综合泛化能力。 虽然在个别任务上被开源小模型拿走了最高分,但 Gemini 是唯一一个在所有 10 项任务中准确率全部保持在 70% 以上的模型。它在 Cart Pole 任务