论文
VERDICT:基于分歧感知共识的多模态推理免训练逐步验证
VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus
摘要
多模态大语言模型生成的推理链常包含细微错误,从而导致错误答案。当前的验证方法存在明显局限。现有方法要么需要昂贵的标注监督且跨任务表现不一致,要么通过简单聚合来合并来自多个来源的分数,遗漏了一个关键洞见:当这些分数不一致时,这种分歧本身就携带着关于某个推理步骤是否真正有效的重要信息。我们将其形式化为多个彼此独立、冻结的验证器之间的耦合评分问题,可解释为一个具有唯一闭式均衡的协调博弈:一致代表步骤有效,而分歧则揭示不稳定。为此,我们提出一种免训练、领域无关的逐步验证方法,称为VERDICT:通过分歧感知的耦合阈值化进行验证(VERification via Disagreement-Informed Coupled Thresholding)。据我们所知,VERDICT是首个使跨模态分歧结构显式化且可操作的免训练验证器。它通过闭式解计算共识分数,实现分歧感知的过滤与兼顾稳定性的推理步骤排序。在六个基准上的评估显示,VERDICT持续优于基础模型,提升最高达+5.95%,并与需要大量监督的领域专用评论模型表现相当,表明跨模态一致性无需任务特定适配即可提供稳健的验证信号,以及免训练验证(Training-Free Verification)。
