首页 / 资讯详情

李飞飞高徒黄文龙:具身智能需要一次「脑内搜索」革命 | RSS 2026

雷锋网 2026-08-19 06:11 中文

摘要

斯坦福团队提出:机器人不需要见过所有的失败,它只需要学会如何“脑补”另一种可能。 作者丨岑峰 在 AGI 的数字版图里,大语言模型仅靠“读遍互联网文本”就拼凑出了通往智能的通途。这种由 Scaling Law 带来的暴力美学,让整个具身智能行业在过去两年里陷入了一种盲目的“数据崇拜”:人们坚信,只要像训练大模型一样,喂下数以百万小时的视频,机械臂就能在物理世界中无所不能。而在2026 年的悉尼 RSS 大会,AI科技评论注意到,越来越多的研究者开始讨论,物理世界的数据获取具有时间和空间的“不可逆性”——文本可以被瞬间复制亿万次,但机械臂抓取一次杯子,在物理时空中就必须实打实地消耗数秒。更致命的是长尾效应:摩擦、形变、流体……人类根本不可能通过穷举法,去收集齐机器人面临的所有场景。来自斯坦福大学李飞飞实验室的 黄文龙(Wenlong Huang),在“Data-Centric Robotics”主题Workshop的演讲中给出了一个“降维打击”式的解法:抛弃对海量“演示数据”的死记硬背,转向“反事实推理”与“脑内搜索”。作为近年具身智能领域的明星学者,黄文龙的名字此前因 VoxPoser 和 ReKep 两篇里程碑式的论文而广为人知。在这两项研究中,他利用大模型作为空间规划器,将人类的抽象指令转化为三维空间中的“关键点约束”和“价值场”,首次让机器人无需任何行为演示,就能直接根据几何常识完成复杂的操作。而在此次 RSS 2026 的分享中,黄文龙更进一步,首次将这一哲学推向了“3D世界模型”的终极形态——Point-World。这场演讲的重大现实意义在于,它用严密的逻辑和前沿实验,揭示了具身智能下半场的进化范式: Point-World 的诞生,意味着机器人终于拥有了一个可以“零样本预测未来物理演变”的数字孪生大脑。机器人可以在真正动手前,在脑海中虚拟尝试成千上万种“如果我这么做,会发生什么”的反事实可能性,从而在没有人类演示过的情况下,自主创造出诸如“把袜子由内而外翻过来”的独创性行为。同时,黄文龙还展示了仅需 15 小时的 3D 交互数据配合 2D 预训练,就能撬动世界模型的惊人扩展能力。这为具身智能走向“递归自我改进(Recursive Self-improvement)”——即机器人一生的持续自主学习——推开了最后的大门。英伟达 Cosmos 3 正在试图用全模态定义具身生态的“安卓系统”,而黄文龙与斯坦福团队则在底层逻辑上,为全球开发者提供了一套突破算力和数据封锁的“终极进化算法”。以下是黄文龙的演讲分享,AI科技评论根据其英文演讲内容进行了不改原意的编辑:01通过反事实推断实现机器人数据的跨越式扩展演讲者: 斯坦福大学 黄文龙(导师:李飞飞)▎一、 动机:从“演示学习”到“自主探索”大家好非常荣幸与各位讨论机器人数据扩展的新视角。本次 Workshop 的主题是“以数据为中心的机器人学(Data-Centric Robotics)”,而我今天想分享的核心主题是:我们或许可以通过“反事实推断(Counterfactuals)”来有效扩展机器人的能力边界。过去几年,我们在实现“开放世界机器人”的征程中取得了显著进展。从算法层面看,我们拥有了表现力更强的架构,如扩散策略(Diffusion Policies)、基于 VLM 的架构,以及

阅读原文(雷锋网)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。