浙大 × 字节 × 港中深最新研究:告别高斯堆砌,终结 3D 冗余|ECCV 2026
为什么字节要把“空间表示”的体积压掉 90%? 作者丨吴思梦 编辑丨岑 峰 如果有一天,沉浸式直播里的每一个主播都拥有一个实时跟随的 3D 分身,观众可以在任何角度切进去和他对话,看到他的表情、衣服褶皱、头发飘动的细节,那么这个 3D 分身究竟应该有多大? 这不是一个凌空蹈虚的问题,已经逐渐落定变成一个非常具体的工程问题。 过去几年,3D Gaussian Splatting(3DGS)让“从一堆照片里恢复出可以实时渲染的 3D 场景”这件事,第一次变得既真实又快速。今天的 AI 已经非常擅长从多视角图像中重建 3D 世界,而且这个世界的视觉质量已经接近照片级。 3D Gaussian Splatting 从多视角图像重建场景,并支持新视角合成。 图源:Kerbl et al., SIGGRAPH 2023 最直接的例子就是 3D Gaussian Splatting(3DGS) 本身。2023 年的原始论文就是从多张带相机位姿的照片/视频中建立一个 3D Gaussian 表示,然后从 没有真正拍摄过的视角 渲染新画面。论文的核心贡献之一,就是同时做到高视觉质量和实时渲染。 你可以把它想象成这样: 你拿着手机围着一个房间拍了一圈照片。 AI并没有把这些照片简单拼起来,而是从它们之间的关系推断出一个三维表示。 然后你把“虚拟摄像机”放到原来没有拍过的位置,AI依然可以给你渲染出一张看起来像真实照片的画面。 这就叫 Novel View Synthesis,新视角合 成 。 但接下来发生的事情,把这个能力推到了另一个问题面前。 当 3D 不再只是离线建模出来的城市或物体,而是要实时地跟着一个人跑、跟着一个房间转、跟着一次直播传输给成千上万的设备时,问题就从“AI 能不能生成一个 3D 世界”落到了另一个更为朴素的问题:这个 3D 世界,能不能装得下、传得动、跑得起来? 在 ECCV 2026,浙江大学、字节跳动与香港中文大学(深圳)团队的 PointSplat 被收录为会议论文,聚焦面向人体的紧凑型 Gaussian Splatting,正是从这个问题出发的。 论文给它的定位写得很克制:让 3D 人体表示(3D human representations)变得更加紧凑,目标场景是沉浸式直播(immersive live streaming)。它没有声称要解决“所有 3D 表示的存储危机”,但它指出了一个更普遍的方向。 当 3D 开始成为 AI 理解和生成现实世界的重要表示,“表示本身的紧凑性”会变成一个绕不过去的问题。 01 高斯的代价:越真实,就越重 要理解 PointSplat 在做什么,必须先理解 3DGS 在做什么。 3DGS 的基本想法是把一个 3D 场景拆成大量“高斯椭球”。每一个高斯都记录着自己的位置、尺度、旋转方向、透明度,以及外观信息。成千上
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。