论文

无需训练多模态步骤验证的纳什均衡框架

A Nash Equilibrium Framework For Training-Free Multimodal Step Verification

模型推理推理验证与自校正

摘要

多模态 大语言模型 通常会生成包含细微错误的推理链,这些错误会导致错误的答案。当前的验证方法有明显的局限性。博学的批评家需要大量的标记数据,并且在不同任务中表现出不一致的表现。与此同时,现有的 无需训练 方法只是简单地平均来自不同来源的分数,缺少一个关键的见解:当这些分数不一致时,这种分歧本身就携带着关于推理步骤是否真正有效的重要信息。我们提出了一种 无需训练 验证方法,将逐步验证视为专业法官之间的协调问题。我们将这些法官的互动形式化为纳什均衡博弈,其中一致表明步骤有效,而分歧则表明不稳定。我们的方法通过封闭式解决方案计算平衡分数,从而实现分歧感知过滤和稳定性感知推理步骤排序。通过六个基准进行评估,我们的方法比基线模型实现了 2.4% 到 5.2% 的持续改进,并显示出与有学问的批评者相比的竞争性能,证明跨模式一致性(不仅仅是平均置信度)提供了强大的验证信号,而无需针对特定任务进行调整。