论文
MAOAM:使用视觉语言模型统一对象和材料选择
MAOAM: Unified Object and Material Selection with Vision-Language Models
摘要
选择是交互式图像编辑中的核心操作。为了实用,用户应该能够通过文本或基于点击的交互来指定和消除所需选择区域的歧义,并且系统不仅应该支持选择对象,还应该支持选择其他标准,例如材料。基于材质的选择对于重新纹理表面或编辑特定材质实例等任务非常有价值。然而,现有的基于视觉语言模型(VLM)的选择方法是以对象为中心的,通常支持单一交互模式,限制了它们的适用性。因此,在这项工作中,我们提出了屏蔽任何对象和材质(MAOAM),这是一个统一的选择框架,可以在基于文本和基于点击的交互中实现精确的对象和材质级别选择。 MAOAM 利用带有分割头的 VLM 根据用户提示生成像素精确的蒙版:VLM 解释用户的选择意图(对象或材质级别)并编码视觉实体、属性和空间关系,而分割头将输出标记解码为蒙版。一个关键的挑战是缺乏带有文本注释的材料选择数据集。我们提出了一个可扩展的数据生成管道:我们使用材质掩模收集真实和合成图像,并利用 VLM 生成具有丰富视觉语义的材质描述。我们通过点击和基于文本的选择来训练 MAOAM 的多任务目标,以及从材料描述中派生的辅助 VQA 任务,以促进更深入的材料理解。尽管接受了单模态提示的训练,但我们的模型在结合文本和推理点击时在选择方面表现出了突飞猛进的改进,从而实现了灵活的图像编辑工作流程。实验证明了对不同对象、材料和交互场景的准确和连贯的选择,突出了实践中的稳健性。