论文
VIF-Bench:评估多参考图像生成中的视觉指令遵循
VIF-Bench: Evaluating Visual Instruction Following in Multi-Reference Image Generation
摘要
最近的多模态图像生成模型可以将多个图像和文本指令作为输入,从而实现基于参考的生成,不仅可以通过文本引导,还可以通过布局、箭头和姿势提示等视觉指令引导。然而,现有的基准没有评估必须在多个异构视觉指令图像下组成多个参考的联合设置。为了解决这一差距,我们引入了 VIF-Bench,这是一个包含 1,241 项任务的基准,旨在评估这种联合设置中模型能力的边缘,涵盖:(i)在多个异构视觉指令(最多 6 个)下的多参考生成(最多 7 个),(ii)参考图像可能与视觉指令竞争的情况(例如,强烈姿势的主体与目标姿势),以及(iii)视觉指令与不同特异性级别的文本描述的受控比较。利用这些功能,我们发现了三个发现:(1)模型面临依从性与伪影的权衡:一旦模型达到更强的视觉指令依从性,更强的依从性往往与生成图像中更多的指令伪影相一致,(2)在参考图像带有受控属性显着状态的任务(例如,在光方向指令下的霓虹灯照射的对象)的任务中,视觉指令依从性往往较低,对于光和风来说最为一致,以及(3)对于可以理解视觉指令的模型,它通常是较低的。最好直接提供视觉约束,而不是用文本描述它们;使用文本时,适度的细节比详尽的描述效果更好。 VIF-Bench作为开放基准发布,为可控多参考图像生成的公平比较奠定基础。