论文
超越高斯瓶颈:Vision-Transformer 特征空间的拓扑对齐编码
Beyond Gaussian Bottlenecks: Topologically Aligned Encoding of Vision-Transformer Feature Spaces
摘要
现代视觉世界建模系统越来越依赖高容量架构和大规模数据来产生合理的运动,但它们通常无法保留底层 3D 几何或物理一致的相机动态。一个关键的限制不仅在于模型容量,还在于用于编码几何结构的潜在表示。我们提出了 S$^2$VAE,一种几何优先的潜在学习框架,专注于压缩和表示场景的潜在 3D 状态,包括相机运动、深度和点级结构,而不是单独建模外观。基于基于视觉几何的 Transformer (VGGT) 的表示,我们引入了一种新型的变分自动编码器,使用 Power Spherical 潜在分布的乘积,在瓶颈中显式强制执行超球面结构,以在强压缩下保留方向和几何语义。在深度估计、相机姿态恢复和点云重建方面,我们表明几何对齐的超球面潜伏始终优于传统的高斯瓶颈,特别是在高压缩状态下。我们的结果强调潜在几何学是基于物理的视觉和世界模型的一流设计选择。