论文

GeoLatent:几何引导的潜在结构以及用于 3D 推理的路由优化

GeoLatent: Geometry-Guided Latent Structuring with Routed Optimization for 3D Reasoning

应用与实践视觉感知与空间理解

摘要

尽管视觉语言模型取得了进展,但从 2D 图像进行 3D 空间推理仍然具有挑战性。基于文本的方法用离散标记描述中间几何形状,限制了连续空间关系的保真度。连续潜在提供了更丰富的表示,但单一潜在类型并没有明确区分空间任务所需的线索。分解的空间潜伏通过在几何监督下分别表示位置、方向和全局几何来解决这个问题。然而,几何表示仍然可能朝着一个主导方向崩溃,并且不受限制的注意力可能会导致在答案学习过程中未充分利用潜在因素。我们引入了 GeoLatent,将常见残差几何对齐 (CR-GEO) 与路由优化相结合,以构建几何状态,同时促进潜在介导的答案学习。 CR-GEO 将共享的教师几何图形与剩余的教师几何图形分开;路由优化联合训练几何和语言,通过潜在变量暂时指导视觉答案学习,并通过几何监督恢复充分的注意力。在受控比较中,CR-GEO 将几何有效排名从 1.00 提高到 3.87,同时在瓶颈处阻止潜在读数将 128 个固定问题的方向精度从 89.1% 降低到 25.8%。恢复后,差异化的几何表示和潜在介导的视觉路径与直接图像访问一起仍然可用。 GeoLatent 在 SPAR-Bench 上达到了 73.0%,在 SPBench 上达到了 72.1%,在这两种方法上都优于之前报道的方法。