首页 / 资讯详情

Yann LeCun 万字演讲:「预测像素」是伪命题,JEPA 也并非凭空而来 | ECCV 2026

雷锋网 2026-09-23 01:49 中文

摘要

只靠语言和 token,AI 永远跨不过物理世界这道门槛! 作者丨幸丽娟 编辑丨岑 峰 AI 行业的主叙事,曾被 Scaling Law 垄断:更大的模型、更多的 token,更强的文本推理,仿佛只要把语言模型继续堆大,通用人工智能就会自动到来。但这条路线撞上了天花板:预训练的边际收益肉眼可见地递减;模型一旦部署到真实世界,漏洞百出。2026 年,“世界模型”接棒 Scaling Law,成了牌桌上最拥挤的筹码。然而,这个词本身,同时被四条技术路线认领,而它们对“理解世界”这件事,几乎各说各话。第一条赌涌现:Sora、Genie 这类视频生成路线相信,只要下一帧逼得够真,物理规律就会自己从像素里长出来。第二条赌几何:李飞飞联合创立的 World Labs,从底层表征就锁死三维一致性,直接生成可自由探索的虚拟世界。第三条赌仿真:英伟达 Cosmos、Omniverse,把显式物理引擎当作机器人的练兵场。第四条路最孤峭,也最反常识:2018 年图灵奖得主、深度学习三位“教父”之一 Yann LeCun,押注 JEPA(联合嵌入预测架构),它不生成未来,只在抽象表征的空间里预测未来。四条路的根本分歧,本质上在于一个问题:机器要“懂”物理世界,究竟该去复刻它,还是去推理它?前三条都在不同程度上试图让机器“看见并重建”世界;JEPA 却选择另一条路——编码器先丢掉那些根本不可预测的细节,只保留可预测、可规划的结构,然后在抽象表征空间里预测未来。在 LeCun 眼里,连“预测像素”这件事本身都是伪命题:你把摄像头对准房间一角开始录像,下一帧会拍到什么,取决于镜头外有没有人走进来、光线会不会变化。而这些信息,在“当前帧”里根本不存在。在 ECCV 2026 Keynote 演讲《World Models: Enabling the next AI revolution》中,LeCun 给出的,是一个比“Scaling Law 还能撑多久”更根本的判断:只靠语言和 token 训练,AI 到不了人类水平智能,也跨不过物理世界这道门槛。在 LeCun 看来,如果我们要通往真正的通用人工智能(AGI),就必须打破对“生成式”的崇拜。真正的下一章,是让 AI 系统从视频、传感器与交互中,学习并构建世界模型;再用 JEPA 去理解世界,去预测行动后果,去规划出实现目标的动作序列。在Keynote的最后,LeCun给出了三个与众不同、甚至堪称“暴论”的建议:1.别再死磕生成式模型了。2.别再去研究 LLM 了。3.转向联合嵌入,转向抽象表征,转向世界模型。可以说,这次演讲,本质上是对“智能是什么、AI 该往哪走”的一次路线重估。而台下的听众,比谁都更该听懂这句话。作为计算机视觉的研究者,他们最清楚:真实世界远比语言更脏、更连续、更高维。LeCun 要讲的,正是如何让 AI 真正“看懂”并“应对”它。以下是 Yann LeCun 在 ECCV 2026 大会发表的 Keynote 演讲,AI 科技评论基于原英文演讲内容进行了不改变原意的编辑。01我们离 AGI ,还差得远感谢大家的到来。确实如主持人所说,我是一位天文摄影爱好者,一有时间就会拍摄星空,我的演讲封面就是我的 51 和 42号作品。但我今天不是来讲天文的,我是来聊世界模型的。我想开门见山地说一句

阅读原文(雷锋网)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。