首页 / 资讯详情
AI 开始学习「想象未来」:ECCV 2026背后,中国学者如何卡位世界模型
摘要
世界模型开始合流,中国团队正在进入核心问题。 作者丨吴思梦 编辑丨岑 峰 2026 年 9 月 8 日,全球计算机视觉顶级会议 ACM 与 ECVA(European Computer Vision Association)主办的 ECCV 2026 将在瑞典马尔默的 Malmö Arena 和 Malmömässan 两个相邻场馆开幕。这个两年一届、与 CVPR、ICCV 并称计算机视觉领域“三大顶会”的学术盛会,收到了 10473 篇论文投稿,最终接收 2883 篇(接收率 27.5%)。在会议公布的 86 个 workshop 中,有 13 个直接以“World Models”或“Embodied AI”为主题,这是 ECCV 历史上从未出现过的密度。Yann LeCun、Jürgen Schmidhuber、Kristen Grauman、Jamie Shotton 等学者都将作为 keynote 演讲者出现。围绕世界模型的 workshop、tutorial 和论文,从三维理解、视频生成,到具身智能、安全评估,被集中放到了 ECCV 2026 的议程中。届时AI 科技评论将前往现场,进行前沿追踪报道。这背后代表的不只是一个研究方向升温。它意味着 AI 的竞争正在从“理解世界”,走向“预测世界”。而在这场变化中,中国研究者正在试图占据新的位置。01ECCV 2026 为什么突然都在讨论世界模型?世界模型并不是一个新概念。早在强化学习领域,研究者就提出过类似思想:如果智能体能够预测环境变化,就可以减少真实世界中的试错成本。但过去很长时间,这条路线没有真正成为主流。原因很简单:世界太复杂。真实环境中的数据昂贵,物理规律难以建模,而传统模型很难同时处理视觉、动作和长期预测。过去两年的变化,让世界模型重新进入中心。一方面,生成式 AI 的快速发展,让模型第一次具备了预测复杂视觉世界的能力。另一方面,机器人和自动驾驶产业开始迫切需要一种新的学习方式。机器人不能像语言模型一样,通过互联网文本获得经验。它需要面对真实世界里的动作和反馈。于是,一个新的问题出现:AI 能不能像人一样,在行动之前先想象?ECCV 2026 的世界模型相关讨论,实际上集中在四个问题。第一个问题:世界模型如何构建?研究者需要回答,什么样的数据才能训练一个理解世界变化的模型。单纯的视频是否足够?是否需要动作数据?是否需要三维信息?第二个问题:世界模型如何评价?过去评价生成模型,通常关注图像质量。但世界模型不同。一个模型生成的视频再逼真,如果无法帮助机器人完成任务,也没有真正价值。因此,新的评测体系开始关注:模型是否理解空间关系?是否符合物理规律?是否能够预测行动结果?第三个问题:世界模型是否可靠?如果未来进入自动驾驶、人形机器人等领域,错误预测可能带来真实风险。模型不仅需要预测未来,还需要知道自己的预测是否可信。第四个问题:世界模型如何进入行动闭环?这是最关键的一步。预测未来不是目的。帮助机器做出正确行动,才是世界模型最终价值。如果再把这四个问题放到一起看,会发现 ECCV 2026 上世界模型的爆发,并不是单一研究方向升温,而是三股独立趋势在同一年合流的结果。第一股是世界模型本身的范式转移。从 Yann LeCun 2022 年的 JEPA 论文,到 ECC