论文

VisTA:统一多模态模型的视觉弃答

Visual Abstention in Unified Multimodal Models

模型训练监督微调与指令调优

摘要

统一多模态模型(UMM)集成了理解和生成,但它们的生成行为很少受它们对任务的理解所控制。我们将视觉放弃形式化:当在任务规则下不可能实现所请求的视觉转换时,模型应该认识到不存在有效的解决方案,说明这一点,并拒绝生成。我们引入了 Draw-or-Decline (DoD),这是一个跨 7 个任务类别的 1,050 个可行-不可行请求对的基准,共同衡量编辑成功和不可行请求的拒绝。通过评估 8 个 UMM,我们发现编辑能力和弃权是不同的能力:即使是最强的编辑,在 68.4% 的编辑准确率下,在普通指令下也只能拒绝 0.4% 的不可行请求。他们的推理说明了原因:模型很少注意到冲突,而是计划编辑,就好像请求是可能的一样,通常描述图像中没有的对象,或者悄悄地将请求更改为他们可以完成的请求。明确提示这些 UMM 报告不可行性会增加文本拒绝,但会降低编辑准确性。我们提出了VisTA(Visual Transformation and Abstention),一种训练方法,将可行和不可行的例子配对,以便模型在决定是否生成之前判断可行性。我们训练 VisTA-BAGEL 执行可行的编辑并拒绝不可行的请求。在没有任何提醒的情况下,它拒绝了 93.0% 的不可行请求,高于最强编辑器的 0.4%,而错误地拒绝了 0.8% 的可行请求。与提醒不同的是,这不会影响编辑准确性:VisTA-BAGEL 完成了 74.3% 的可行编辑,比 8 个评估的 UMM 中的任何一个都要多。

VisTA:统一多模态模型的视觉弃答:论文原图
图 2:$7$ DoD 任务类别的示例。现实世界中的配对共享一个图像,并用彩色文本标记可行和不可行指令之间的差异。参考文献显示了对可行请求的有效编辑。迷宫对共享一条指令;更改 $1$ 走廊单元会阻塞路径。