论文

用于文本到图像生成中可靠评估的技能对齐注释

Skill-Aligned Annotation for Reliable Evaluation in Text-to-Image Generation

模型评测评测方法与指标

摘要

文本到图像 (T2I) 生成技术发展迅速,随着模型之间性能差异的缩小,可靠的评估变得至关重要。现有的评估实践通常在异构评估技能中应用统一的注释机制,例如李克特量表或二元问答(BQA),尽管它们的性质存在根本差异。在这项工作中,我们通过技能对齐注释的视角重新审视 T2I 评估,其中注释策略反映了每种评估技能的基本特征。我们系统地将技能一致的注释与统一的基线进行比较,并表明它产生更一致的评估信号,具有更高的注释者间一致性和更高的模型稳定性。最后,我们提出了一个自动化管道,它实例化了所提出的评估协议,通过空间空间定位反馈实现可扩展和细粒度的评估。我们的工作强调,改进图像评估的基础可以提高可靠性和效率,而无需简单地扩展注释工作。我们希望这能激发对改进评估协议的进一步研究,将其作为可靠模型评估的核心组成部分。