首页 / 资讯详情

不堆 Transformer,斯坦福吴佳俊如何用物理重新定义多模态融合?|ECCV 2026

雷锋网 2026-09-11 09:39 中文

摘要

视觉、听觉、触觉三种数据,其实是同一组物理属性在不同感官通道上的投影。 作者丨陈淑瑜 编辑丨岑 峰 2026年9月8日,欧洲计算机视觉会议 ECCV 在瑞典马尔默召开。在 9 月 9 日的“ Embodied Multimodal Reasoning in Physical Environments(物理环境中的具身多模态推理)”专题分场上,斯坦福大学计算机科学助理教授吴佳俊发表了一场横跨视觉、声音与触觉的演讲。这已经是吴佳俊两个月内的第三场重要演讲,而每一场的切入口都不同。8月20日,他在德国不来梅领取了 IJCAI 2026“计算机与思想奖”,发表获奖演讲《Building Visual and Physical Intelligence Through Code》, 彼时他系统性阐述了如何将经典符号 AI 的几何、物理先验定义为“物理代码”,并与现代基础模型深度缝合,铺就了一条从“看懂画面”到“具身动作交互(4D)”的全新物理智能范式。9月8日,他在 ECCV 期间的“Robotic Manipulation Research”Workshop 上转向了操作与规划:让基础模型自动发现“原子技能”及其前置与后置条件,构成可组合的抽象,使机器人能从极少演示泛化到长程任务,并配套一系列评测基准。而9月9日这场,他换了一个方向。前两次的路径都是“从视觉出发,往下游延伸”——先理解世界,再去规划与操作;这一次则是在感知端横向拉平: 将视觉、听觉、触觉视为同一组物理属性在不同观测通道上的投影。举例来说,一个塑料物体,看起来像塑料,摸起来像塑料,敲起来也像塑料。他要回答的是一个更前置、也更难的问题:当我们几乎没有任何数据时,怎样把这三种模态融在一起?在这场多模态感知的演讲中,吴佳俊没有沿用“把视觉、音频、触觉拼起来喂给 Transformer”的常规做法,也没有退回“先估计状态、再跑物理仿真”的经典路径,而是给出了一个更前置的答案:用同一组物理属性,为三种感官建立共同的坐标系。吴佳俊直击当前多模态融合的痛点:进入新领域、面对从未见过的物体时,声音与触觉的数据几乎为零,真正稀缺的不是架构而是原则。他系统性阐述了如何把几何、材质与刚度这类物理属性,既作为从视频扩散模型中蒸馏出的学习目标(PhysDreamer),又作为条件化生成模型的中间接口(WonderPlay),并进一步延伸到声音的可微分渲染(DiffImpact、RealImpact)与柔性电子皮肤(DexSkin),铺就了一条从“看懂画面”到“听出材质、摸出力度”的跨模态物理智能范式。以下是吴佳俊在 ECCV 2026 期间发表的演讲精编稿,AI 科技评论基于其演讲内容进行了不改原意的翻译编辑:▎《Physics-Grounded Multimodal Perception:从视觉、声音到触觉的统一物理底座》主讲人:吴佳俊(Jiajun Wu),斯坦福大学01当数据极少时,模态该怎么融这部分讲的是多模态感知,所以我想还是讲点跟多模态相关的内容。于是我回去翻了翻我们自己的工作,几年前做过的一些声音研究现在回看依然很有意思,我自己还想再往前推一推,所以也打算一并讲讲。视觉是一部分,我们也会讲到触觉,另外还有听觉。问题在于,怎么把这些多感官信息融合起来,构建出更好的表示,从而帮我们做感知和

阅读原文(雷锋网)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。