论文

CROSS-Bench:视觉证据是否影响了正确决策对象?

Visual Evidence Under Cross-Examination: Evaluating and Controlling Decision-Level Evidence Use in Vision-Language Models

模型评测模型推理应用与实践判别式推理与决策基准与评测资源通用理解与问答

摘要

视觉语言模型越来越多地通过作物、区域和工具产生的观察进行推理。然而,一项观察可能会影响答案,但不会使其支持的候选项受益。我们研究候选绑定的视觉贡献:有效的证据应该有所帮助,使其支持关系无效应该消除其附加效果,有效的重新绑定应该将该效果重定向到新支持的候选。我们引入了 CROSS-Bench,这是一个包含 28,000 个决策问题的基准,并在专用评估子集上进行了匹配的失效和重新绑定测试。我们的 RIVET 界面保留证据的同一性和不确定性,组成候选条件响应,并单独控制其强度。共享证据实验表明,任务准确性和证据所有权可能存在差异。在匹配的能力和训练下,RIVET 将标准化效应转移从 0.512 增加到 0.651,其中明确的证据具有积极的效应。在常见的评估示例和重复的决策层拟合中,这一优势仍然存在。根据原始输入预测的证据,RIVET 改进了 相对于没有辅助证据的相同模型,四个冻结骨干网的交叉基准准确率平均提高 5.70 pp。这些结果将视觉证据的效用与其效果的特定候选项目标分开。

CROSS-Bench:视觉证据是否影响了正确决策对象?:论文原图
图 3:RIVET 概述。指定计划的视觉要求; Preserve 通过共享类型化接口获取、绑定和读取观察结果。 Compose 使用候选查询来组织和读取完整的证据集; Bound 缩放了所得的后验响应。突出显示的 e*e^{\ast} 遵循管道中的一个说明性支持。这里 𝐪t=max⁡(𝐩t,ϵ)\mathbf{q}_{t}=\max(\mathbf{p}_{t},\epsilon) 对于 t∈{0,1}t\in\{0,1\}。