首页 / 资讯详情
没有全科优秀,具身模型别想进入百万小时
摘要
原力灵机登顶 RoboDojo:一个专门给机器人"卸妆"的考场。 最近的朋友圈,几乎被机器人运动会和 WRC 2026 上的各种视频刷屏了。看多了机器人百米冲刺、跳远,再看各个展台叠衣服、冲咖啡,很容易得出一个结论:机器人时代来了。然而,如果你不幸参与过这些演示背后动辄几千次的调试与过拟合,你就会清楚这里面的水有多深。行业内管这种情况叫"Demo 滤镜"。滤镜有多厚?说实话,即使你积累了一些行业知识,在现场盯着看,你也未必分得清:这个演示到底是提前编好的动作,还是模型在实时驱动。这些信息差,让具身行业多少有些鱼龙混杂。好在,学术界还留着几面"照妖镜",比如 RoboDojo。01一个不许摆拍的考场这是一个来头不小的权威评测:由香港大学多媒体实验室牵头,联合 UC 伯克利、清华等全球近 20 所顶尖机构,背后是知名仿真基准 RoboTwin 的原班人马。它干的事用一句话概括:给全世界的机器人模型办一场统一高考。其中,42 道题,考泛化、记忆、精细操作、长程执行、开放语义理解五个科目;另外还有18 道题,考场里摆着三种双臂机器人(ARX X5、Piper 等),灯光、复位流程、部署接口全部统一,评审双盲打分,既看结果也看过程。翻译一下:不许自带考具,不许挑题,不许摆拍,仿真、真机分开考。成绩单相当惨烈。截至今年 7 月,仿真榜上 30 多个参评模型里,不乏大家熟悉的 π0.5(Physical Intelligence)、英伟达 GR00T-N1.7、OpenVLA-OFT,全是这个赛道叫得上名号的选手,头部模型的平均成功率只有 8.80%,作为对比,人类专家是 76.03%。真机榜更惨:头部模型总体成功率 12.8%,人类 100%。最难看的是开放语义任务,成功率只有 1.67%。1.67% 是什么概念?考 60 次,蒙对 1 次。而同一个考场里的人类,满分。所以这个榜单暴露的,不是哪家公司不行,而是一个行业级现实:现在的具身模型,绝大多数离落地还很远。然而最近,RoboDojo 的一家中国具身头部公司:原力灵机。它的通用具身基础模型 DM0.5,以 24.90 的综合得分、19.34% 的平均成功率,双项第一,综合排名登顶。02分数之外,先看它干活的样子从去年底开始,AI 科技评论判断一个具身模型的含金量时,就越来越关注榜单之外的东西,它干活的样子。毕竟,分数是给人看的,活是给世界干的。我们特地找到了 DM0.5 的 GitHub 仓库,结果看到了一些让人意外的细节。先从一个测试视频开始。桌上随机摆着红、绿、蓝三块积木。给你三个杯子,从左到右把它们挨个盖住。等颜色全部遮住,再按红、绿、蓝的顺序,把杯子依次揭开。听着像逗小孩的。没错,三四岁的小孩确实能轻松完成,顺便还会嫌你无聊。但让机器人来呢?很遗憾,绝大多数"具身大脑"都会当场露馅:不是颜色记错,就是步骤乱套。因为现在的具身模型,大多和金鱼差不多:走一步,忘一步。主流 VLA 模型做决策时,只看眼前这一帧,或者最近几帧画面。十秒内的短任务没问题,抓个杯子、按个按钮,靠本能反应够了。但真实世界的活儿几乎都是长程的:做一顿饭半小时,收拾一间屋子一小时,流水线一站一整天。没有记忆,机器人就永远只能活在 10 秒的 Demo