论文

知道何时不回答:视觉语言模型中的弃权和拒绝推理

Knowing When Not to Answer: Abstention and Refusal Reasoning in Vision--Language Models

模型评测安全与风险评测

摘要

许多医疗状况需要通过详细的、多背景的临床评估来诊断,而不是仅仅根据视觉外观。尽管如此,视觉语言模型(VLM)越来越多地被要求以涉及医学或诊断判断的方式解释图像,当此类推论不受支持时,就会引发安全问题。自闭症谱系障碍的诊断需要行为和发育证据,而不是静态的面部照片。我们审核 VLM 是否放弃这种无法回答的配对图像查询,以及表达式是否会影响非放弃的选择。我们引入了 PARITY(与重用身份配对评估),这是一组合成的、人口统计平衡的身份控制中性/表情肖像对,具有中性-中性控制。所有身份都是合成的,没有 ASD 状态;由于无法从图像中回答该查询,因此任何非弃权选择都将被视为有害归因。在当代的 VLM 中,我们发现拒绝优先模型和投机模型之间存在明显的区别;在后者中,某些表达不成比例地引发有害选择。临床护栏和单图像框架大大增加了弃权率,表明在提示和界面设计方面采取了可行的缓解措施