论文

DensiTok:在前馈 3D 高斯模型内部补全视点词元

DensiTok: Making Feed-Forward 3D Gaussian Splatting See More Views Than It Is Given

模型推理解码与生成控制

摘要

前馈 3D 高斯分布 (3DGS) 在单次前向传递中重建场景,用跨多个场景训练的网络取代按场景优化。然而,随着输入图像数量的下降,其质量急剧下降。瓶颈位于重建头的上游:从一些未提出的视图中,它们读取的内部表示没有未观察到的区域的证据,留下了空洞、漂浮物和模糊。常见的补救措施以像素的形式提供证据,使用图像或视频生成器合成额外的视图并对它们进行重新编码,这不仅成本高昂,而且在构造上与 3D 不一致。相反,我们强化了证据本身。我们推出 DensiTok,这是一个用于预训练前馈 3DGS 模型的插件模块,可直接致密其内部几何形状 token,使冻结的 骨干模型 表现得好像它观察到的视图比给出的视图多得多。 DensiTok 将这些 token 压缩为紧凑的 潜空间,在以相机几何为条件的单个流匹配步骤中完成未观察到的视点的 潜变量,并将它们解码回原始重建头的 token。相同的模块设计可以集成到不同的预训练预测器中,同时保持每个 骨干模型 及其重建头冻结。低维 潜空间 的完成不需要图像合成或额外的编码器通道。在三个预训练的 骨干模型 和两个基准测试中,DensiTok 持续改进了稀疏视图重建,并弥补了与密集视图重建的大部分差距。

DensiTok:在前馈 3D 高斯模型内部补全视点词元:论文原图
图 4:用于几何潜在增强的 DiT 块的架构。时间和相机嵌入为注意力和 MLP 分支生成每 token AdaLN 移位、缩放和门参数。框架和全局块的区别仅在于它们的注意力范围。