论文
知道不该回答什么:视觉语言模型中的选择性不合规
Knowing What Not to Answer: Selective Non-Compliance in Vision-Language Models
摘要
视觉语言模型 (VLM) 有望对适当的请求做出有益的响应,同时拒绝遵守不正确、不安全、不可行或无法答复的请求。然而,现有的基准主要评估整个查询级别的不合规情况,假设每个请求要么保证合规,要么要求扣留合规。在实践中,现实世界的查询可能包含可回答的内容和应保留合规性的组件的混合体。在本文中,我们介绍了 KoNA,这是一个评估 VLM 中选择性不合规情况的基准,涵盖五个类别:错误前提、视觉不可访问性、普遍未知、任务可行性和安全性。每个任务评估两种功能:配对的单一查询和复合查询下的查询级不合规性和组件级不合规性。我们对不同 VLM 的评估表明,模型经常无法适当地拒绝、纠正或放弃,并且当查询需要选择性不合规时,这些失败会变得更加明显。为了应对这一挑战,我们使用需要选择性不合规的 KoNA 示例以及应该收到直接答案的完全可回答集来微调 VLM。我们经过微调的模型在不合规准确性方面取得了显着提高,同时在很大程度上保持了完全可负责任务的性能。这些结果表明,微调模型可以区分可负责的组件和需要不合规的组件,并以适合任务的方式做出响应。