论文
VeraRetouch:用于多任务推理照片修饰的轻量级完全可微框架
VeraRetouch: A Lightweight Fully Differentiable Framework for Multi-Task Reasoning Photo Retouching
摘要
推理照片修饰已经获得了巨大的关注,需要模型来分析图像缺陷、给出推理过程并执行精确的修饰增强。然而,现有方法通常依赖于不可微分的外部软件,造成优化障碍并遭受高参数冗余和有限泛化的困扰。为了应对这些挑战,我们提出了 VeraRetouch,这是一种轻量级且完全可微分的多任务照片修饰框架。我们采用0.5B视觉语言模型(VLM)作为中央智能,根据指令和场景语义制定修饰计划。此外,我们开发了一个完全可微的润饰渲染器,它取代了外部工具,通过照明、全局颜色和特定颜色调整的解耦控制潜力来实现直接的端到端像素级训练。为了克服数据稀缺的问题,我们引入了 AetherRetouch-1M+,这是第一个用于专业修饰的百万级数据集,通过新的逆退化工作流程构建。此外,我们提出了 DAPO-AE,一种增强自主审美认知的强化学习 后训练 策略。大量实验表明,VeraRetouch 在多个基准测试中实现了最先进的性能,同时保持了显着更小的占用空间,从而实现了移动部署。我们的代码和模型可在 https://github.com/OpenVeraTeam/VeraRetouch 上公开获取。