论文
CROSS-Bench:视觉证据是否影响了正确决策对象?
Visual Evidence Under Cross-Examination: Evaluating and Controlling Decision-Level Evidence Use in Vision-Language Models
摘要
视觉语言模型越来越多地通过作物、区域和工具产生的观察进行推理。然而,一项观察可能会影响答案,但不会使其支持的候选项受益。我们研究候选绑定的视觉贡献:有效的证据应该有所帮助,使其支持关系无效应该消除其附加效果,有效的重新绑定应该将该效果重定向到新支持的候选。我们引入了 CROSS-Bench,这是一个包含 28,000 个决策问题的基准,并在专用评估子集上进行了匹配的失效和重新绑定测试。我们的 RIVET 界面保留证据的同一性和不确定性,组成候选条件响应,并单独控制其强度。共享证据实验表明,任务准确性和证据所有权可能存在差异。在匹配的能力和训练下,RIVET 将标准化效应转移从 0.512 增加到 0.651,其中明确的证据具有积极的效应。在常见的评估示例和重复的决策层拟合中,这一优势仍然存在。根据原始输入预测的证据,RIVET 改进了 相对于没有辅助证据的相同模型,四个冻结骨干网的交叉基准准确率平均提高 5.70 pp。这些结果将视觉证据的效用与其效果的特定候选项目标分开。
