论文
通过生成顺序干预评估解释驱动的视觉语言推理
Evaluating Explanation-Driven Vision-Language Reasoning via Generation Order Interventions
摘要
自然语言解释生成是揭示和评估视觉语言推理的关键机制。先前关于解释驱动的视觉语言模型的工作主要遵循事后(答案优先)范式,隐含地表明受监督的基本原理可以反映潜在的推理过程。相比之下,现代大型视觉语言模型越来越表现出理性第一代的趋势,它与结构化、逐步推理更加紧密地结合在一起。在这项工作中,我们系统地评估解释是否与受控实验设置下的单个生成步骤内的模型预测存在因果关系,明确消除知识密集型 QA、视觉蕴含和组合基础基准中不必要的思维链或其他中间推理过程。我们发现更大的模型成为可靠地支持大规模理性优先推理的先决条件。然而,答案优先生成在结构化输出中不太容易出现与格式相关的错误。总体而言,解释顺序、模型规模和预训练知识、特定于任务的微调和任务结构共同影响预测准确性和推理可信度。