论文
SmartPhotoCrafter:自动摄影图像编辑的统一推理、生成和优化
SmartPhotoCrafter: Unified Reasoning, Generation and Optimization for Automatic Photographic Image Editing
摘要
传统的摄影图像编辑通常需要用户拥有足够的审美理解来提供适当的指令来调整图像质量和相机参数。然而,这种范式依赖于人类对审美意图的明确指导,而这种指导通常是含糊的、不完整的,或者对于非专家用户来说是难以理解的。在这项工作中,我们提出了 SmartPhotoCrafter,一种自动摄影图像编辑方法,它将图像编辑制定为紧密耦合的推理到生成过程。该模型首先通过图像评判器模块进行图像质量理解并识别缺陷,然后摄影艺术家模块实现有针对性的编辑以增强图像吸引力,从而无需明确的人工指令。采用多阶段训练流程:(i)基础预训练,建立基本的审美理解和编辑能力,(ii)推理引导的多编辑监督适应,融入丰富的语义指导,(iii)协调推理到生成强化学习,共同优化推理和生成。在训练过程中,SmartPhotoCrafter 强调生成逼真的图像,同时支持图像恢复和修饰任务,并始终遵守颜色和色调相关的语义。我们还构建了一个特定阶段的数据集,逐步构建推理和可控生成、有效的跨模块协作,并最终实现高质量的摄影增强。实验表明,SmartPhotoCrafter 在自动摄影增强任务上优于现有的生成模型,实现了逼真的结果,同时对修饰指令表现出更高的色调敏感性。项目页面:https://github.com/vivoCameraResearch/SmartPhotoCrafter。