论文
MOTIVE:学习视觉语言模型何时需要多视角自验证
When to Rethink: Learning Multi-Perspective Self-Verification for Vision-Language Models
摘要
视觉语言模型(VLM)在多模态推理中取得了强大的性能,但它们仍然容易生成看似合理但不正确的答案。 Self-验证提供了一种实用的方法来提高答案可靠性,而无需依赖外部判断,但现有方法通常依赖于单个验证标准或固定提示,导致可靠性估计不完整且不稳定。我们首先系统地分析验证器能力和提示设计如何影响验证性能。我们的研究结果表明,更强大的验证者可以提供更可靠的判断,而验证的性能对提示选择高度敏感,没有任何一个提示能够在任务中始终占据主导地位。在这些发现的指导下,我们提出了 \texttt{MOTIVE},一个 Multi-View Self-VerificatiOn wiTh RelIability-Guided SelectiVE Rethinking 框架,用于可靠的多模态推理。 \texttt{MOTIVE} 从互补的验证角度评估每个候选答案,并通过基于正确性的多视图验证学习来学习正确性对齐的可靠性分数。在推理过程中,这个分数决定接受或重新思考的决定,允许直接返回可靠的答案,而不确定的答案则触发历史引导的重新思考。跨不同多模式基准和 VLM 骨干模型 的大量实验表明,\texttt{MOTIVE} 始终优于强大的自我验证和自我校正基线。进一步的结果表明,可靠的验证改善了接受或重新思考的决策,并减少了不必要的推理回合,从而无需外部判断即可实现更可靠、更高效的自我验证。
