首页 / 资讯详情
国内第一视角数据最早押注者,北大卢宗青:隐空间才是具身的路
摘要
具身智能的确定性技术还没出现,世界模型可能也不是答案。 作者丨邓哲敏 编辑丨齐铖湧 25 年 6 月,卢宗青在智源大会上提出一个判断:人类视频,是具身智能唯一可以 scale up 的数据路径。彼时,行业的注意力集中在机器人本体、素材场搭建、数据飞轮上,没有多少模型公司把目光投向第一视角人类视频。卢宗青不一样,他不仅提出这个判断,而且按这个方向积累数据,到现在已经积累了超过 50 万小时。卢宗青是北京大学计算机学院长聘副教授,长期担任 ICML、NeurIPS、ICLR 高级领域主席,也是国内隐空间路线最早的系统性推进者。2025 年,他创立了 BeingBeyond 智在无界,走的是一条与主流视频生成路线截然不同的技术路径——隐空间世界动作模型(Latent World-Action Model):不生成画面,直接在 embedding space 里联合预测机器人下一步做什么、世界将如何响应。这条路线训练成本是视频生成路线的约 1%,推理速度足以支撑实时控制,但有一个缺点——没有画面,不好展示。在具身智能融资热、demo 竞赛激烈的当下,这是一个需要定力才能坚持的选择。不过卢宗青本人并不把这当成笃定的押注。他在采访中说了一句话,让人意外:具身基础模型的确定性技术尚未出现,世界模型可能都不是。他的逻辑是,GPT 能堆出来,是因为先有了 Transformer 和 Next Token Prediction,有了确定性范式,堆数据才有意义。具身现在还没到那一步,“我们现在连确定性技术是什么都不知道。”这不是自谦,是判断。26 年 7 月 28 日,BeingBeyond 正式发布 Being-H0.8——全球首个隐式触觉世界动作模型。Being-H0.8 首次将触觉模态引入大规模模型预训练,并将视觉、触觉、动作以及未来状态变化统一到同一隐空间(latent space)。这使机器人不仅能够理解“看到了什么、做了什么、接触到了什么”,还能够进一步理解“世界因此发生了怎样的变化”,从而形成对物理交互过程更加完整的认知与预测能力。围绕技术路线的选择、数据的真实价值、行业分工如何形成,以及通用具身基础模型究竟还有多远的路要走,AI科技评论(雷峰网公众号)与卢宗青展开了对话,以下为未经改变原意的编辑整理:01从北大到创业:纸上的东西不会自己变成产品▎AI科技评论(雷峰网公众号):你是北大教授,做了多年学术,又出来做具身创业。今年我们看到很多高校老师出来创业,李一鸣、赵昊,包括您,感觉学术界出来的人今年特别多。你当时是怎么做这个决定的?卢宗青:也不算突然转变。我本来就在研究具身相关的方向,只是到了某个节点,觉得这件事不能只停留在发论文。学术研究可以验证一个方向是否可行,但你判断完了,纸上的东西不会自己变成产品。具身尤其如此,它需要真机去验证,需要真实场景去跑,需要在真实的物理世界里一遍遍失败再调整,这些事情在学校里做不了。创业是让研究落地的方式,不是切换赛道。▎AI科技评论:我们观察到,今年出来创业的学者,有一部分明显有一种"不融就来不及了"的紧迫感,尤其是自动驾驶背景出来的人,对产业节奏特别敏感。你会有这种焦虑吗?卢宗青:大家的目标不一样。对于我们来讲,我们的目标就是做模型,build up 具身的 foundation m