论文

知道何时不回答:评估多模态推理系统中的弃权

Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems

模型评测基准与评测资源

摘要

有效弃权 (EA)、认识到证据不足并避免回答,对于可靠的多式联运系统至关重要。然而,视觉语言模型(VLM)和多智能体系统(MAS)的现有评估范式假定了可回答性,从而推动模型始终做出响应。弃权已经在纯文本环境中进行了研究,但多模态的研究仍然不足;当前的基准测试要么忽略不可回答性,要么依赖于错过实际故障模式的粗略方法。我们引入了 MM-AQA,这是一个基准,它通过沿两个轴的转换从可回答的实例构造不可回答的实例:视觉模态依赖性和证据充分性。通过评估涵盖封闭和开源模型的三个前沿 VLM 以及跨 2079 个样本的两个 MAS 架构,我们发现:(1)在标准提示下,VLM 很少放弃;即使简单的置信基线也优于此设置,(2)MAS 提高了弃权率,但引入了准确性与弃权权衡,(3)顺序设计匹配或超过迭代变体,表明瓶颈是校准错误而不是推理深度,(4)模型在图像或文本证据不存在时弃权,但尝试与退化或矛盾的证据进行协调。有效的多模式弃权需要弃权意识训练,而不是更好的提示或更多的代理。