首页 / 资讯详情
RSS 2026 实录:当 AGI 撞上「物理之墙」,想象力成为具身智能的第一生产力
摘要
从“像素导演”转向“具身大脑”:RSS 2026“机器人世界模型”专题现场见证,想象力正在终结具身智能的“数据暴政”。 编辑丨岑峰 2026 年 7 月的悉尼,RSS 会场内,一种复杂的情绪正在蔓延:一半是火焰,一半是海水。火焰来自于大模型在云端的持续狂飙,海水则来自于具身智能在现实落地中的“物理阵痛”。在此之前,全球 AI 行业笃信一套名为“暴力美学”的成功公式:巨大的参数量 + 几乎无穷的互联网数据 = 涌现的智能。 这一公式在处理文本、图像甚至是视频生成时无往不利。但当人们试图将这套逻辑直接“平移”到机器人身上,让 AGI 进入物理世界时,那道无形却坚硬的“物理之墙”出现了。在云端,数据可以被无限次复制和合成;但在物理世界,每一次机械臂的抓取、每一次足式机器人的迈步,都受限于时间的线性和物理空间的约束。当“暴力美学”撞上“物理硬墙”,那个在数字世界里几乎无所不能的 Scaling Law,在试图拧开一个生锈的螺丝钉或在杂乱的厨房里寻找一只空气炸锅时,表现出了令人沮丧的笨拙。AI 行业最核心的矛盾已经转移:我们需要机器人像人类一样,拥有在行动前进行“想象”的能力。在 RSS 2026 的 “Robot World Models” 主题Workshop 上,这种共识达到了顶峰。世界模型不再被视为一个“视频生成器”,而是被定义为机器人的“逻辑中枢”和“虚拟沙盒”。如果说一年前的讨论还停留在生成视频有多逼真,那么今天的议题只有一个:世界模型如何让机器人摆脱死记硬背,学会举一反三?这一Workshop上半场的几场演讲,本质上是具身智能领域的一次集体转身:从 Pi 团队对零样本泛化的探索,到 OpenDrive Lab 对组合式逻辑的坚守,再到英伟达对全模态底座的重构,它们共同指向了同一个趋势:单纯依靠“喂数据”来模拟动作的路径已经面临边际效应递减。换言之,我们不再需要一个只会“背诵”动作轨迹的机器人,我们需要一个像人类一样,在行动之前拥有“想象力”的智能体。这种想象力,在学术语境下被称为“世界模型(World Model)”。它代表了具身智能从“被动反应”向“主动预测”的代际跨越。机器人必须在脑海中先运行一个高保真的物理沙盒:如果我伸出这只手,这个杯子会碎吗?如果我推开这扇门,后面的空间会坍塌吗?只有当机器人学会在行动前进行“视觉推演”和“因果校准”,智能才不再是飘在空中的 Token 组合,而是真正扎根于大地的物理生存能力。2026 年,具身智能正式告别“大力砖飞”的草莽时代,转向以“想象力”为核心驱动的精密演进。以下便是来自 RSS 2026 现场,关于这场“思维变轨”的Workshop的上半场实录:01从“视频生成”到“动作引擎”Pi 团队的核心成员 Laura Smith 在开场演讲中,用一个极其生活化的例子,捅破了具身智能泛化的窗户纸。“世界模型不是用来拍电影的,它是用来提供‘目标图像(Goal Image)’的。” Laura 强调。在 Pi 展示的实验中,一台从未学习过“操作空气炸锅”的机器人,在没有任何遥操作数据(Teleop Data)的前提下,仅凭看了一段人类炸红薯的视频,就成功完成了任务。这背后的逻辑在于:机器人不需要在现实中练习一万次炸红薯,它通过世界模型“脑补”出了炸红薯完成后的视觉终态。世界模型将人类视频中的常识(如