论文

X-MULTI:基于 VLM 的成像因子解缠,用于因子感知图像合成

X-MULTI: VLM-based Imaging Factor Disentanglement for Factor-Aware Image Synthesis

模型训练监督微调与指令调优

摘要

文本到图像生成中的图像因子解缠旨在独立控制图像采集属性,例如相机镜头类型、传感器类型、视点和域,以实现组合泛化。这应该让模型合成训练数据中未观察到的新颖因素组合,例如将鱼眼镜头与训练数据中从未观察到的事件传感器配对。最近的工作 MULTI 引入了可学习的、特定于因子的嵌入来解开成像因子,以及因子对齐精度 (FAA) 指标来评估解缠质量。我们确定并解决了两个独立的限制。首先,MULTI 的像素级重建目标仅在观察到的成像因子组合上监督模型,不为新颖的组合提供直接的训练信号。因此,我们提出了 X-MULTI,它使用预训练的视觉语言模型(VLM)来监督训练期间合成的新因素组合。其次,我们表明 FAA 指标表现出严重的跨因素相关泄漏,歪曲了真实的解缠结质量。因此,我们提出改进的 FAA (I-FAA),它采用特定于因子的增强策略来打破这些相关性并实现更严格的评估。实验表明,与 MULTI 相比,X-MULTI 在新型组合上实现了改进的因子对齐。此外,我们表明 FAA 中的相关泄漏扭曲了对真实因子解缠的评估,而 I-FAA 减少了这种泄漏,因此提供了更稳健的因子对齐评估。