首页 / 资讯详情
浙大 × 字节 × 港中深最新研究:告别高斯堆砌,终结 3D 冗余|ECCV 2026
摘要
为什么字节要把“空间表示”的体积压掉 90%? 作者丨吴思梦 编辑丨岑 峰 如果有一天,沉浸式直播里的每一个主播都拥有一个实时跟随的 3D 分身,观众可以在任何角度切进去和他对话,看到他的表情、衣服褶皱、头发飘动的细节,那么这个 3D 分身究竟应该有多大? 这不是一个凌空蹈虚的问题,已经逐渐落定变成一个非常具体的工程问题。 过去几年,3D Gaussian Splatting(3DGS)让“从一堆照片里恢复出可以实时渲染的 3D 场景”这件事,第一次变得既真实又快速。今天的 AI 已经非常擅长从多视角图像中重建 3D 世界,而且这个世界的视觉质量已经接近照片级。3D Gaussian Splatting 从多视角图像重建场景,并支持新视角合成。图源:Kerbl et al., SIGGRAPH 2023最直接的例子就是 3D Gaussian Splatting(3DGS) 本身。2023 年的原始论文就是从多张带相机位姿的照片/视频中建立一个 3D Gaussian 表示,然后从没有真正拍摄过的视角渲染新画面。论文的核心贡献之一,就是同时做到高视觉质量和实时渲染。你可以把它想象成这样:你拿着手机围着一个房间拍了一圈照片。AI并没有把这些照片简单拼起来,而是从它们之间的关系推断出一个三维表示。然后你把“虚拟摄像机”放到原来没有拍过的位置,AI依然可以给你渲染出一张看起来像真实照片的画面。这就叫 Novel View Synthesis,新视角合成。但接下来发生的事情,把这个能力推到了另一个问题面前。 当 3D 不再只是离线建模出来的城市或物体,而是要实时地跟着一个人跑、跟着一个房间转、跟着一次直播传输给成千上万的设备时,问题就从“AI 能不能生成一个 3D 世界”落到了另一个更为朴素的问题:这个 3D 世界,能不能装得下、传得动、跑得起来? 在 ECCV 2026,浙江大学、字节跳动与香港中文大学(深圳)团队的 PointSplat 被收录为会议论文,聚焦面向人体的紧凑型 Gaussian Splatting,正是从这个问题出发的。论文给它的定位写得很克制:让 3D 人体表示(3D human representations)变得更加紧凑,目标场景是沉浸式直播(immersive live streaming)。它没有声称要解决“所有 3D 表示的存储危机”,但它指出了一个更普遍的方向。当 3D 开始成为 AI 理解和生成现实世界的重要表示,“表示本身的紧凑性”会变成一个绕不过去的问题。 01高斯的代价:越真实,就越重要理解 PointSplat 在做什么,必须先理解 3DGS 在做什么。 3DGS 的基本想法是把一个 3D 场景拆成大量“高斯椭球”。每一个高斯都记录着自己的位置、尺度、旋转方向、透明度,以及外观信息。成千上万、几十万个这样的高斯一起渲染,就构成了一个看起来真实的 3D 世界。 这种表示有三个非常突出的优点:真实、可渲染、速度快。 它让神经辐射场(NeRF)时代的“高质量但慢”第一次变成了“高质量且实时”。 但它也带来了一个非常直接的代价。 高斯数量越多,显存占用越大,计算开销越高,存储体积越大,传输带宽要求也越严格。当场景从一栋楼变成一个城市,从一个静物变成一个需要实时跟着动的人,这些成本都会被