首页 / 资讯详情
英伟达 Cosmos 3 深度拆解:它想做具身智能时代的「安卓系统」| RSS 2026
摘要
当 AGI 的大脑决定向边缘迁徙,英伟达拿出了统治机器人进化的“终极剧本”。 编辑丨岑峰 2026 年,大模型行业正经历一场前所未有的“体感位移”。那个在纯数字世界几乎无往不利的 Scaling Law,在试图跨越到物理世界时,正遭遇物理规律、空间约束和长尾数据的残酷审判。AI 行业最核心的矛盾正日趋明显:云端算力的指数级爆发,与机器人终端落地的步履蹒跚,构成了一种日益撕裂的鸿沟。这种割裂感,在 7 月悉尼 RSS 2026的最后一天,被推向了最高潮。在 “Robot World Models(机器人世界模型)” Workshop 上,传统机器人学界对物理因果的“敬畏”,正与 AI 工业界对规模效应的“迷信”正面交锋。就在这场范式撞击的火山口上,英伟达物理AI专家Max Li,为我们拆解了其新发布的重量级产品——Cosmos 3。这不再仅仅是一个更逼真的视频生成器:它是全球首个在同一个 Transformer 架构下,彻底打通了文本、视觉、音频和动作全模态的世界基础模型。如果说过去两年的具身智能还处于“组装机”时代:开发者需要吃力地将视觉模型、语言模型和控制算法像乐高一样拼凑在一起,那么 Cosmos 3 的出现,则宣告了“整机一体化”时代的到来。在现场演讲中,Max Li 还释放了一个明确信号:具身智能的下半场将不再属于数据中心,而是属于边缘侧。通过让 AGI 的大脑迁徙到 Jetson 等边缘设备上实时运行,英伟达正在终结机器人背着服务器跑的包袱。这背后是英伟达作为算力霸主的终极野心:它不仅要做硬件的垄断者,还要做具身智能时代的“安卓系统”。它正试图通过定义一套标准化的“大脑与肢体”协议,让全球碎片化的机器人形态,都能在 Cosmos 的逻辑底座上实现统一进化。以下是英伟达物理 AI 专家 Max Li 的演讲实录,AI科技评论基于原英文演讲内容进行了不改原意的翻译编辑:▎演讲实录:Cosmos 3: An OmniModel of Text, Video, and Action for Physical AI主讲人:Max Li | NvidiaMax Li:感谢主持人的精彩介绍。很荣幸今天能在这里向大家展示我们最近的研究成果:Cosmos 3。这是一个面向物理AI的多模态世界基础模型。在物理AI领域,目前最大的挑战之一就是数据。与计算机视觉智能体或大语言模型(LLM)相比,获取物理世界的数据会受到时间和空间线性特征的极大限制:我们无法像扩展算力那样轻松地去扩展物理数据。这也是为什么我们认为,仅仅靠远程操作或合成数据是无法完全解决这个问题的,我们需要更核心的技术。因此,我们引入了世界基础模型(World Foundation Model)的概念,希望它能成为许多物理 AI 应用的真正基石。▎世界基础模型的核心能力同时,我们花了很多时间去思考:一个合格的世界基础模型究竟应该由什么组成?特别是从智能体的角度来看,一个模型应该如何与世界互动才能称得上是“基础”?我们认为有几个关键能力至关重要:理解世界(Understanding the World): 就像上一位讲者 Laura 提到的,如果你想从微波炉里拿食物,模型必须先理解当前环境的状态,否则根本无法下手。模拟未来(Simulating Outcomes): 智能体必须能够模拟执行特定