论文
用于定量空间推理的几何感知测试时学习
Geometry-Aware Test-Time Learning for Quantitative Spatial Reasoning
摘要
视觉语言模型 (VLM) 中的定量空间推理旨在从 2D 图像和自然语言查询推断 3D 空间中对象之间的空间距离和方向关系。尽管最近取得了进展,但 VLM 空间推理在分布变化下仍然很脆弱,这主要是由于 3D 监督的成本高昂。因此,当面对新的对象配置或重新表述的空间查询时,模型通常会产生不一致或矛盾的预测,从而揭示学习的表示与基础几何之间的不对齐。为了解决这个问题,我们提出了 TTL-SR,一种用于定量空间推理的几何感知测试时学习框架,它利用几何一致性约束和未标记的测试数据来使模型适应目标领域。具体来说,TTL-SR 通过几何耦合的辅助查询来增强输入查询,通过自适应几何触发过滤不可靠的预测以构造结构化的 词元级 伪标签,并仅使用测试数据在几何感知多目标损失下更新模型参数。实验结果表明,TTL-SR 显着提高了空间推理性能,Qwen3-VL-4B-Instruct 和 SpatialRGPT-VILA-1.5-8B 在 Q-Spatial-ScanNet 数据集上的准确率分别提高了 6.47% 和 9.41%。