论文
当构图不合理时:人类识别人工智能生成图像中的缺陷
When Composition Doesn't Add Up: Humans Identifying Defects in AI-Generated Images
摘要
*赵楚林和胡若琪对这项工作做出了同等贡献。当提示涉及复杂的组成因素(例如多个实体和多个属性)时,最先进的文本到图像(T2I)模型表现出明显的系统性缺陷。在本文中,我们研究了人类如何识别此类缺陷。具体来说,我们从人、手、物体和场景四类中手动选择 651 张表现出复杂构图特征的参考图像,通过手动编辑 ChatGPT 生成的提示来导出强调构图因素的提示。然后,我们将提示输入三个选定的 T2I 模型以生成 AI 图像,并进行全面的主观研究以识别其缺陷。对于每张图像,29 位参与者提供多标签评估,指定缺陷类型和位置。该研究产生了合成人工智能生成的图像缺陷 (CO-AID) 数据集,包括参考图像、提示、人工智能生成的图像以及缺陷位置和类型的信息。实验结果表明,在 CO-AID 上训练深度模型既可以预测 AI 生成图像中的缺陷,又可以优化 AI 图像生成,证明了其可用性和有效性。数据库和补充材料可在以下网址获取:https://github.com/Future-IQA/CO-AID。