SIEVES:选择性预测通过视觉证据评分进行推广
SIEVES: Selective Prediction Generalizes through Visual Evidence Scoring
摘要
多模态 大语言模型 (MLLM) 在视觉语言任务上实现了更强的性能。即使传统的视觉问答 (VQA) 基准接近饱和,可靠的部署也需要满足现实世界中的分布外 (OOD) 场景中的低容错能力。准确地说,选择性预测旨在提高覆盖范围,即系统回答的输入份额,同时遵守用户定义的风险级别。这通常是通过为每个答案分配一个置信度分数并放弃那些低于特定阈值的答案来实现的。现有的选择性预测方法依赖于 logits 等模型内部信号或隐藏表示来估计隐式置信度分数,而这些信号不适用于前沿闭源模型。为了在 VQA 中实现可靠的泛化,我们要求推理器模型在回答时生成本地化的视觉证据,并设计一个选择器,该选择器可以显式地学习仅使用模型输入和输出来估计推理器提供的本地化质量。我们表明,与不使用视觉证据定位的基线相比,SIEVES(通过视觉证据评分进行选择性预测)在具有挑战性的 OOD 基准(V* Bench、HR-Bench-8k、MME-RealWorld-Lite、VizWiz 和 AdVQA)上将覆盖率提高了三倍。除了更好地泛化到 OOD 任务之外,SIEVES 选择器的设计还可以传输到专有推理机,而无需访问其权重或 logits(例如 o3 和 Gemini-3-Pro),从而提供超出仅归因于准确性的覆盖范围提升。我们强调,SIEVES 可以泛化所有经过测试的 OOD 基准和推理器模型(Pixel-Reasoner、o3 和 Gemini-3-Pro),无需针对基准或推理器特定的训练或调整。代码可在 https://github.com/hector-gr/SIEVES 上公开获取。