论文
INCORT:通过输入转换和置信路由增强视觉语言模型的免训练空间推理
INTCORT: Training-Free Spatial Reasoning Enhancement for Vision-Language Models via Input Transformations and Confidence Routing
摘要
视觉语言模型(VLM)在多模态任务中表现出了卓越的能力,但在空间推理方面仍然表现出较差的能力。现有的依赖训练和无需训练的增强方法分别面临着高计算成本、灾难性遗忘和内部机制干扰的问题,从而损害了一般能力。在这项工作中,我们首先验证两个关键假设:适当的几何图像变换和查询反转变换可以恢复错误的空间预测,并且正确的预测比错误的预测表现出更高的关系标记置信度。基于这些发现,我们提出了 INCORT,一种免训练的空间推理增强框架,它通过输入转换构建多个推理视图,并通过关系词元置信路由聚合它们的预测,而无需修改 VLM 的内部机制。几个常用基准测试的实验结果表明,INTCORT 显着提高了不同 VLM 的空间推理精度,比所有模型和基准测试平均提高了 10.01%。与之前的作品相比,INTCORT 实现了卓越的性能,提高了高达 25.01%。