论文

低基础分数并非无基础的判断:识别多模态监督中的可感知性混淆

A Low Grounding Score Is Not an Ungrounded Judge: Identifying the Perceptibility Confound in Multimodal Oversight

模型评测评测方法与指标

摘要

模型评审现在大规模监督多模态系统,过滤训练数据,选择输出,并提供塑造多模态推理模型的奖励。信任一个意味着首先检查它是否使用了证据,而这种检查本身就值得仔细审查,因此我们询问视觉基础的反事实探索是否能够衡量它所声称的内容。探测器编辑图像,使地面真相翻转,保持推理轨迹固定,并询问结论是否成立。我们将其形式化为“判决基础分数”,并表明它不能以此类分数的方式来解读。判决仅对达到评审决策相关阅读的编辑做出反应,因此分数受到编辑的可感知程度的限制,除非编辑使属性更易于阅读,否则错误是片面的:分数只能让评审看起来不那么踏实。因此,实际的失败是一个误报,审计员丢弃了可用的监督员。根据我们提出的假设,我们表明这个缺失的数量不仅是有界的,而且是从同一审计协议已经收集的三个数量中确定的,这使得误报率可以直接测量,而不仅仅是一个问题。审核九名评审后,我们发现预测的排序严格适用于我们的整个主要池,并且那里的典型评审仅对大约一半的编辑采取行动,否则它可以解析其属性。应用保守的拒绝阈值可以证明几个单元格完全是错误警报,最清楚的是判断器基本上每次都检测到注入的错误,同时仍然进行评分,就好像它根本没有使用图像一样。接下来的规则是,图像端反事实分数永远不应该单独报告:未经编辑的图像上的检测探针会确定其上限,证明其错误警报,并且无需额外运行。