论文

ReGround:通过自我诊断和视觉复查恢复多步推理中的视觉基础

ReGround: Restoring Visual Grounding in Multi-Step Reasoning through Self-Diagnosis and Visual Re-Examination

模型推理推理验证与自校正

摘要

视觉语言模型(VLM)在多步骤推理过程中通常会失去视觉基础:随着推理链变长,后面的推理步骤越来越依赖于语言先验而不是图像证据。我们确定了与这种退化相关的一致基准级别签名:在来自四个基准的 2,510 个重新检查的样本中,图像标记的注意力熵通常在第一轮期间下降,并在图像重新注入后再次上升。然而,我们发现有效的视觉复查需要两个互补的成分:图像重新注入和有针对性的自我诊断。如果没有针对性的诊断,重新检查甚至可能会损害绩效,而准确的自我诊断会产生巨大的收益——关键基准上的几个点的波动,表明诊断质量是重新检查对我们的环境是否有利或有害的关键因素。我们提出了 ReGround,这是一个两阶段框架,可教会 VLM 自我诊断脱离视觉证据的问题并有选择地重新检查视觉证据,而无需进行架构修改或外部工具。通过能力引导,来自同一模型系列的更强变体仅在数据构建期间提供诊断脚手架,而策略模型在推理时学习自主诊断并保留大部分辅助收益。对两个 VLM 主干的八个基准进行的实验显示出一致的增益,特别是在视觉密集型多步骤推理任务上,同时相对于工具增强基准仅产生适度的推理开销。项目页面:https://sespoir.github.io/reground-page/。代码:https://github.com/sespoir/ReGround。