论文

COMEX:用于可解释的美学图像裁剪的基于构图的基准和学习框架

COMEX: A Composition-Grounded Benchmark and Learning Framework for Explainable Aesthetic Image Cropping

模型评测基准与评测资源

摘要

可解释的美学图像裁剪不仅需要本地化视觉上令人愉悦的裁剪,还需要解释为什么它是首选。现有的裁剪和解释方法在很大程度上将解释视为事后文本生成,而忽略了构图,而构图是将裁剪决策与可解释推理联系起来的关键美学因素。在本文中,我们将可解释的美学图像裁剪重新表述为结构化裁剪-构成-解释问题。为了支持这种设置,我们引入了 COMEX,这是一个通过图像扩展和 IO 反转管道构建的新基准。 COMEX 包含 33,161 个四元组,每个四元组由扩展图像、裁剪框、构图类别和基于构图的解释组成,从而实现裁剪定位、构图理解和解释生成的联合学习。我们进一步提出了一个两阶段的SFT+GRPO框架,其中有监督的微调建立了结构化输出协议和基本裁剪能力,GRPO进一步改进了作物质量、成分预测和解释忠实性。我们在 COMEX 上对 15 个大型视觉语言模型和现有裁剪方法进行了基准测试,为基于构图的可解释美学裁剪建立了综合测试平台。 COMEX 和之前基准测试的实验证明了我们框架的有效性和可移植性,在各个评估指标上都具有出色的性能。