论文

揭示和塑造视觉语言模型中 3D 场景拓扑的潜在表示

Uncovering and Shaping the Latent Representation of 3D Scene Topology in Vision-Language Models

模型评测模型行为与机制分析

摘要

数十年的认知科学证实,人类通过形成认知地图来导航环境,认知地图被定义为 3D 空间的异中心和拓扑保留表示。虽然现代视觉语言模型 (VLM) 展示了来自 2D 自我中心输入的新兴空间推理,但仍不清楚它们是否构建了类似的 3D 内部表示。在本文中,我们证明当前的 VLM 确实拥有 3D 场景的潜在拓扑图,但它被非几何视觉语义(例如颜色和形状)严重掩盖。通过跨场景线性特征提取来隔离该空间子空间,我们提取了一个干净的空间子空间,该空间子空间因果地控制模型的空间输出。我们以数学方式塑造这种潜在表示,并证明其与场景 3D 高斯核图的拉普拉斯特征图的对应关系,在连续极限下收敛到物理 3D 空间。受这种几何识别的启发,我们进一步引入了一种基于狄利克雷能量的 VLM 的数学原理潜在正则化方法。将此单项正则化器应用于简单合成数据上的最小 500 步监督 VLM 微调 (SFT),可显着改进现实世界的空间基准,在涉及场景拓扑理解的空间任务中,性能优于标准 SFT 和竞争基准高达 12.1%。源代码可在 https://github.com/pittisl/vlm-latent-shaping 获取