论文

DEPICT:按答案一致性为文生图对齐打分

DEPICT: Scoring Text-to-Image Alignment by Answer Agreement

模型评测基准与评测资源

摘要

图文对齐是计算机视觉的核心问题,应用于描述评估、幻觉检测、数据策展与文生图(T2I)生成器基准测试。随着T2I模型改进,基准测试要求提升——需要能发现缺对象、换属性、数错与忽视否定等一系列问题的指标。近期工作以偏好数据微调评估器或提示视觉语言模型(整体或分解验证问题)应对。但既有方法都有不足:微调指标绑定单一骨干与训练分布;整体指标漏细节;分解指标依赖固定"是"假设——该假设失效时惩罚忠实图像。相反,我们提出DEPICT——训练自由指标:以基于图像与仅基于图像描述的答案间的期望一致性取代固定参考答案,并按图像描述对答案的确定程度加权。替换固定参考后,我们的一致性规则把否定准确率从19%提升到88%。为恢复分解中丢失的语境,DEPICT把该一致性分与整体分合并。在五基准、三族十一骨干上评估DEPICT:超越全部训练自由指标,并在三个人类相关性基准中的两个超过微调评估器。