论文
AesFormer:将日常照片变成美丽的回忆
AesFormer: Transform Everyday Photos into Beautiful Memories
摘要
在日常摄影中,捕捉到的具有美学吸引力的时刻通常带有结构缺陷(例如构图、相机视角或姿势),而现有的修饰和肖像增强方法无法修复这些缺陷。我们将美学照片重建(APR)定义为通过结构重建来提高照片的美学质量,同时保留主体身份和场景语义。尽管图像编辑模型的最新进展使 APR 变得可行,但它们往往缺乏审美理解,导致编辑结果在语义上合理但在美学上却很薄弱。为了解决这个问题,我们提出了 AesFormer,这是一个两阶段框架,可将美学规划与图像编辑分离。在第一阶段,美学动作模型(AesThinker)沿着七个渐进摄影维度分析输入并输出可执行的编辑动作;我们进一步应用 GRPO-A 来鼓励对 SFT 之外的各种行动计划进行广泛探索。在第 2 阶段,动作条件编辑器 (AesEditor) 在这些动作的指导下执行结构编辑。为了支持 APR,我们构建了一个基于视频的语料库挖掘管道 (VCMP) 并构建了 AesRecon,这是一个包含 9,071 个严格对齐(差、好)图像对的基准。实验表明,AesFormer 大幅提升了 APR 性能,与 Nano Banana Pro 具有竞争力。代码可在 https://github.com/PKU-ICST-MIPL/AesFormer_ICML2026 获取。