论文
CROP:通过构图推理和优化偏好进行专家对齐的图像裁剪
CROP: Expert-Aligned Image Cropping via Compositional Reasoning and Optimizing Preference
摘要
美学图像裁剪旨在通过空间裁剪改善图像的构图来增强图像的美学质量。以前的方法通常依赖于显着性预测或检索增强,忽略了任务的核心要求:对构图和美学的深刻理解。因此,基于显着性的方法很难在复杂场景中进行组合权衡,而基于检索的方法则盲目地参考相似的案例,缺乏对独特场景的自适应推理。这两种方法都无法将自动裁剪结果与人类专家的结果保持一致。为了解决上述问题,我们提出了一种新的范式,将美学裁剪重新表述为多模态推理任务,旨在激活 VLM 的美学分析和理解能力。我们设计了一种构图推理和优化偏好方法(CROP),指导 VLM 像专业摄影师一样思考。它将一个复杂、主观的审美问题解构为一个“分析-建议-决策”的过程,通过对场景元素和构图原则的分析,一步步推理。同时,我们的专家偏好对齐模块使模型的决策符合人类专家的审美。跨多个数据集的广泛实验验证了我们的方法的优越性和组件有效性。