论文

S2Tok:用可更新空间Token压缩长序列三维场景

S2Tok: Streaming 3D Gaussian Reconstruction with Persistent Spatial Tokens

模型架构模型优化应用与实践新型架构稀疏化视觉感知与空间理解

摘要

流式 3D 重建需要的不仅仅是一系列几何预测:它需要持久的场景状态,可以包含新的证据并在观察到达时保持可渲染。潜在空间标记为此目的提供了一种有前途的表示,但是从图像集合构建它们留下了如何在线维护它们的开放性,其中每次观察都可以重新访问已知区域并揭示新内容。我们引入了 S2Tok,这是一种前馈框架,可以从未校准的图像流中维护尺寸自适应的持久场景状态。其中心思想是将现有表示的更新与选择性扩展区分开来。融合空间信息的Transformer将每个传入的观察与持久场景标记集成在一起,而学习的准入模块则有选择地扩展表示以限制冗余存储。分层解码器和高斯头将演化状态转换为非像素对齐的 3D 高斯,从而无需缓存先前帧即可实现新视图渲染。四个基准的实验表明 具有紧凑高斯表示的有竞争力的流渲染质量。这些结果支持将潜在空间标记作为在线 3D 重建的持久计算状态,将学习的场景更新与显式高斯渲染相结合。

S2Tok:用可更新空间Token压缩长序列三维场景:论文原图
图 2.S2Tok 管道。编码器将新帧 𝐈i\mathbf{I}_{i} 映射到标记 𝐟i\mathbf{f}_{i}。 SS-Transformer 联合更新帧标记和现有空间标记𝐒i−1\mathbf{S}_{i-1}。准入模块附加选定的帧标记以形成 𝐒i\mathbf{S}_{i},并将其带入下一步。分层解码器和高斯头解码并预测高斯属性。 ⊕\oplus 表示串联。