论文

跟踪、验证和纠正:多模态空间推理的 无需训练 框架 LLM

Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs

模型推理推理验证与自校正

摘要

尽管多模态 大语言模型 (MLLM) 取得了实质性进展,但其空间推理仍然可能产生与输入图像不一致的中间判断,从而使错误通过推理链传播并影响最终答案。现有方法主要通过训练或附加空间信息来改进空间推理,而没有考虑推理过程本身是否忠实于模型输入。我们的研究表明,不忠实的推理链会显着降低最终答案的准确性。为了解决这个问题,我们提出了一个模块化的 无需训练 框架,用于空间推理验证和校正。该框架构建了一个空间证据图(SEG),它将从思想链推理中提取的原子空间证据与视觉实体、空间关系、源步骤和视觉证据相关联。空间证据可靠性评估 (SERA) 根据对象存在、定位和几何测量来评估视觉证据的可靠性。然后,该框架识别出与可靠的视觉证据相矛盾的最早的空间证据单元,并指导原始 MLLM 修改后续推理和最终答案。在 15 个模型数据集设置中,我们的方法实现了 68.94% 的平均准确率,平均优于比较基线 8.55 个百分点。我们的代码将开源。