首页 / 资讯详情
AI 读过一切,却没经历过任何事:Ropedia 发布 HOMIE Gen2,给具身智能补「经验」这一课
摘要
8 月中旬,新加坡的一场公开演讲上,南洋理工大学副教授、Ropedia 首席科学家刘子纬抛出了一个问题:为什么读过整个互联网的 AI,进了物理世界,却连一杯咖啡都冲不好?他的回答是:“AI 读过一切,却几乎没有经历过任何事情。它从未真正冲过一杯咖啡,自然也不知道该怎么做。”刘子纬教授在新加坡演讲的现场照片这种分裂在今天的 AI 身上随处可见:感知模型能把冲咖啡的教程讲得头头是道,生成式模型能合成一段以假乱真的冲咖啡视频;可一旦真的伸出机械臂,同样的智能常常连一次可靠的抓取都完成不了。能听懂,能想象,就是做不好。这道裂缝,此刻正卡着整个具身智能行业。AI 科技评论了解到,就在这场演讲之后不久,由联合创始人兼 CEO 陈昭熹与联合创始人兼 CTO洪方舟共同创办的 Physical AI 公司Ropedia,正式发布了新一代多模态采集系统HOMIE Gen2。这套关于“经验”的判断,最终落到了一台约 380g 的头戴设备上:让 AI 从人类真实行为中,补上它缺失已久的“经验”这一课。对于这台设备要做的事,CEO 陈昭熹有一个很形象的说法:“学做一道菜,只看别人做的视频,可能知道最后成品长什么样;但真正亲手做过,才会知道什么时候下锅、该用多大力、食材发生了什么变化。”HOMIE Gen2 要做的,就是把这些真实操作中的动作、时机和环境变化完整记录下来,让机器人学到的不只是结果,还有过程。Ropedia 发布 HOMIE Gen201从“看见世界”到“经历世界”HOMIE Gen2 背后的“经验”思路,其实可以追溯到刘子纬教授更早的研究之中。他的团队做过一个名为 EgoLife 的项目:六个人共同生活七天,录下约五十小时的第一视角视频,并同步了外部视角、音频、视线与动作。模型要在这些数据里回答的,不是“画面里有什么”,而是一些更接近生活本身的问题:那罐咖啡豆昨天被谁挪去了哪里?上一次冲煮为什么失败?用他的话说,这是在为物理世界构建“记忆层”。在他看来,真正的 Physical AI 要能跨越数小时、数天甚至不同的人去推理,这是语言模型从未面对过的时间尺度。刘子纬教授团队的 EgoLife 项目,发表于 CVPR 2025除了时间之外,他还反复强调另一个常被忽略的约束:行动。今天的 AI 可以慢慢想,物理世界却不会停下来等模型想完。“物理智能,是延迟约束下的智能。”这句话划出了具身智能与数字智能的分界线:后者只需要答对,前者必须在毫秒之间答对。跨越时间的记忆、延迟约束下的行动,两条线索指向同一个结论:机Physical AI 需要的,不再只是关于世界的描述,而是真实发生在物理世界中的完整经验。02什么才算“人类经验”每一代AI系统都从不同的数据基本单元中学习,学习来源定义了智能的上限。感知 AI 把像素变成标签,回答“那里有什么”;生成式 AI 把提示词变成内容,回答“它可能是什么样子”;Physical AI 的基本单元则是一个完整的经验片段,它把行动、后果和下一次行动串在一起,回答“如果我这样做,会发生什么,下一步该怎么办”。基于这一判断,Ropedia 进一步给“经验”划出了明确的边界:视频不是经验,RGB、动作捕捉、深度中的任何单一模态都不是,把它们简单叠在一起也不是;只有当动作、意图、环境、时序上下文与多模态信息同时在场、互相对齐,一段记录才配得上这个词。Ropedia HOMIE GEN2 Demo换一个角度说:语言模型学的是人类写下来的东西,Physical AI 要学的,是人类做了什么、世界如何回应、接下来又发生了什么。文字可以被爬取,经验却