论文
从识别信息不足到拒答:改善VLM的回答可靠性
From Knowing to Abstaining: Bridging the Representation-Action Gap in Vision-Language Models
摘要
视觉语言模型(VLM)避免无法回答的问题的能力与准确回答可回答的问题的能力同样重要。最近,出现了一些评估和改善 VLM 弃权的基准,但它们有很大的局限性。首先,样本通常在图像或问题中包含显示可回答性的快捷提示,而明确的“无法回答”选项进一步妨碍了对自发弃权的准确评估。其次,作为训练数据,它们通常仅提供二进制标签,而没有用于更深入监督的细粒度解释。为了解决这些限制,我们引入了带有基本原理的可视化应答能力诊断(VAD-R),这是一个通过快捷过滤和质量验证的两阶段管道构建的基准,以防止可应答性泄漏。每个示例都注释有分步原理和因果证据差距标签。对 VAD-R 上最先进的开源和闭源 VLM 的评估显示,自发弃权率有限,平均召回率分别仅为 11.4% 和 16.3%。探测分析表明,某些层中的隐藏状态表示可以有效地区分可回答性,但这种区别未能在最终响应中体现出来。受这一观察的启发,我们引入了 Rep2Act,一种表示到行动的对齐方法,可将潜在的责任意识转化为明确的弃权决策。 Rep2Act 将 Qwen2.5-VL-3B 对 VAD-R 的动作准确率从 56.67% 提高到 86.33%,将 Qwen2.5-VL-7B 从 59.33% 提高到 88.67%。在发行外 TUBench 上,Rep2Act 仅用 3B 模型就取得了 53.3% 的平均 F1 分数,分别超过闭源 GPT-4 Turbo 和 GPT-4o 16.2% 和 1.1%。