论文

VG-CoT:通过扎根的思想链实现可信赖的视觉推理

VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought

模型评测基准与评测资源

摘要

大视觉语言模型 (LVLM) 的进步需要基于局部区域的精确推理,将模型的逻辑忠实地建立在实际视觉证据中。然而,由于大量的手动注释以及多步推理与相应图像区域之间缺乏明确的对齐,现有数据集在可扩展性方面面临限制,这限制了模型可信度的评估。为了应对这些挑战,我们提出了视觉基础思想链(VG-CoT)数据集,该数据集通过全自动三阶段管道将每个推理步骤与图像中的真实视觉证据明确链接。该管道首先使用最先进的检测和 OCR 模型提取对象和文本级视觉证据,然后使用 GPT-4o 生成逐步的基础推理,最后通过基本原理驱动的开放集检测过程完善基础。此外,我们还引入了一个新的基准,可以从三个互补维度全面评估 LVLM 推理:基本原理质量、答案准确性和推理-答案一致性。使用具有代表性的 LVLM(包括 LLaVA-1.5 和 Qwen2-VL)进行的实验表明,大多数评估指标都得到了一致的改进,证实 VG-CoT 有效增强了可信、基于证据的推理,同时保持了可扩展且经济高效的数据集构建。数据集和代码将在接受后公开发布,以促进进一步的研究。