首页 / 资讯详情
突破具身智能物理死角:IJCAI 2026 具身智能泛化与控制突破
摘要
告别理想仿真,中国学术团队用物理工程方案回应落地挑战。 作者丨张璐 编辑丨岑峰 过去一年多里,具身智能似乎按下了快进键。从 Physical Intelligence 发布的π₀到开源社区追捧的OpenVLA,VLA大模型一路高歌猛进。在各种标准基准测试和精心搭建的实验室 Demo 中,机械臂叠衣服、拿取物品流畅得宛如人类,动辄刷出 90% 甚至 95% 以上的成功率。然而,当全行业都在欢呼“机器人的 GPT 时刻”到来时,前沿学术界与产业界却爆发了一场剧烈的反思:这些动辄数十亿参数的具身大模型,真的学会“举一反三”了吗?还是在“死记硬背”?在主流学术视角中,VLA 大模型像是给机器人装上了具备常识与规划能力的“大脑”。但要让机械体真正干好精细活,仅有一个聪明的大脑远远不够。最新实验数据表明,面对物品位置的随机挪动或新指令组合时,纯端到端大模型往往会受到“空间过拟合”的约束,末端执行成功率会出现剧烈衰减。这恰恰说明:具身智能要真正走出实验室,不仅需要大模型提供常识和高层决策,更需要扎实的工程技术去打造精准、稳健的“小脑”。下面雷峰网盘点入选 IJCAI 2026 的 6 项中国团队成果。它们并非要替代大模型,而是从空间泛化、盲区感知到极端控制,为具身智能补齐了通往真实物理世界最关键的拼图。01解决死记硬背,大模型如何搞定未见场景具身智能的核心瓶颈之一在于真正的泛化能力。目前的VLA动辄拥有数十亿参数,但在面对没有见过的指令组合或场景变化时,表现往往大打折扣。▎泛化成功率跌破 21%:不重训模型,如何把成功率拉回 83%论文:《VLAs Are Confined yet Capable of Generalizing to Novel Tasks》作者:李全义(论文独立作者,一路从北邮本科、爱丁堡硕士深造至新加坡国立大学 CLeaR Lab 博士,现任 Oxa 高级应用科学家)论文链接:https://arxiv.org/pdf/2505.03500v5假设你给机器人下达了一道指令:“把奶酪放进柜子”。如果在训练数据里,这块奶酪总是摆在桌子左侧,那么当你在现实中把奶酪挪到桌子右侧时,会发生什么?在李全义博士最新的研究中,发生了令人啼笑皆非的一幕:主流 VLA 大模型依然会机械地伸向桌子左侧。模型根本没有理解什么是“奶酪”,它只是把词汇与训练集里的固定物理坐标进行了强行绑定。 无论是π₀、OpenVLA 还是 UniVLA,虽然它们在标准测试集里能刷出 95% 以上的超高成功率,但李全义博士专门构建了 20 个外推新任务的 libero-ood 基准。在这个不按套路出牌的考场上,主流 VLA 的成功率瞬间断崖式跌落到了 21% 以下(OpenVLA 仅 1%,π₀-fast 为 17%,UniVLA 为 21%)。原因是:大模型在决策时根本不关注物体本身,只盯着机械臂末端与终点坐标。但这项研究最精彩的部分在于“反转”。李全义博士通过机制可解释性方法,从大模型内部提炼出了代表任务语义的“文本隐变量”。在模型残差流中实施“文本隐变量插值(TLI)”后,在完全不重新训练模型的前提下,直接将 π₀ 在外推新任务上的成功率从 9%提升到了 83%!这项由中国年轻学者完成的独立研究,不仅用严谨的数据证实了现有的端到端微调确实落入了死记硬背的陷阱,更