论文
Stable-Layers:以视觉模型评分强化学习改进图像分层
Stable-Layers: Fine-Tuning Image Layer Decomposition Models with VLM-Scored Reinforcement Learning
摘要
Stable-Layers只依赖视觉语言模型反馈微调预训练图像分层模型,无需配对监督。基于Qwen-Image-Layered,方法用LoRA和Flow-GRPO为每张图采样多个分层候选,由VLM评分,再按组相对优势更新策略。主要难点是单独评价时VLM评分过于集中,GRPO缺少可学习的组内差异。两阶段流程先按五项面向编辑的标准分别评分,再把全部候选组成网格并列校准。相对基础模型,Crello上的结果具有更好的图层分离、更少空白或大量伪影的图层,以及更低的逐层重建误差。