论文
地点、内容、原因和重要性:文本到图像反馈的结构化缺陷定位
Where, What, Why, and Importance: Structured Defect Grounding for Text-to-Image Feedback
摘要
尽管生成的图像越来越逼真,但文本到图像 (T2I) 模型仍然表现出局部、微妙且结构复杂的故障。诊断这些故障需要实例级反馈来回答缺陷发生的位置、缺陷类型、缺陷原因及其对整体图像质量的重要性。虽然最近的密集反馈方法超越了标量监督,但它们以热图为中心的表示仍然将诊断制定为像素场回归,这使得定位变量基数缺陷并将语义原因与个体故障联系起来变得困难。为了解决这个表示瓶颈,我们提出了结构化缺陷定位(SDG),它将 T2I 诊断转换为结构化集预测,通过将每个缺陷建模为(位置、类型、原因、重要性)元组。为了使这个公式可训练和可测量,我们引入了 SDG-30K,这是一个 30K 图像数据集,在四个现代 T2I 生成器中带有基于框的注释,以及专用的评估协议 SDG-Eval。在此结构化表示的基础上,我们进一步提出了一个诊断到对齐框架,其中视觉语言模型(VLM)充当 SDG 检测器,BoxFlow-GRPO 将预测的缺陷集转换为盒派生的、重要性加权的空间奖励,以进行扩散模型对齐。大量实验表明,我们的 SDG 探测器在结构化缺陷定位方面优于领先的专有 VLM,而 SDG 引导的奖励持续改进 T2I 对准并支持局部图像细化。这些结果将 SDG 确立为一个统一的实例级接口,用于诊断、评估和增强现代生成模型。