论文
离散标注,连续偏好:重新思考准确且可推广的美学图像裁剪的监督
Discrete Annotation, Continuous Preference: Rethinking Supervision for Accurate and Generalizable Aesthetic Image Cropping
摘要
美学图像裁剪旨在从美学和构图方面识别图像的最佳裁剪。虽然基于注释数据的监督是基础,但该领域一直受到一个长期存在的问题的阻碍:现有数据集受到(1)人类主观性和(2)仅限于固定采样网格的严格离散性的影响。这些有缺陷的注释不仅限制了训练模型的准确性和泛化性,而且严重扭曲了公平评估。为了克服这个问题,我们建议将人类裁剪偏好建模为裁剪空间上的多峰、连续且尖锐的场。我们引入了连续偏好场(CPF),它通过(1)峰值聚类、(2)离格细化、(3)负整形和(4)场组装从离散注释中恢复密集的偏好景观。基于此,我们训练了 CPIC,这是一种基于 VLM 的裁剪模型,通过 GRPO 和 CPF 奖励进行优化,克服了模板崩溃,实现了最先进的性能和出色的域外泛化。最后,为了解决长期存在的基准评估危机,我们引入了 CPCD,对现有地面实况框进行全面重新校准。通过利用 CPF 纠正主流基准中的网格限制伪影,CPCD 为未来的裁剪研究奠定了严格可靠的基础。大量的实验和用户研究证明了我们的 CPF、CPIC 和 CPICD 的优越性。代码、型号和数据可在 https://github.com/zzqingz/CPIC. 获取