论文
用于电子商务图像生成的元素感知小组学习
Element-Aware Group Learning for E-Commerce Image Generation
摘要
图像生成和编辑方面的最新进展使提示词质量成为电子商务创意的关键瓶颈。视觉语言模型 (VLM) 可以根据产品图像和元数据生成图像编辑提示,但进一步提高其提示编写能力需要 后训练 提供生成图像的反馈。组相对策略优化(GRPO)是这种结果级奖励优化的自然框架。然而,它只在完全提示的水平上分配信用,尽管图像质量通常取决于特定的设计元素,例如构图、背景和卖点的呈现。现有的细粒度信用分配方法通常需要步骤级监督或训练出的价值评估器。为了解决这个问题,我们提出了 EAGLE-GRPO(用于电子商务图像生成的元素感知小组学习),它将以小组为中心的奖励分解为预定义的元素。我们将元素级信用分配视为核岭回归问题,并得出封闭式解决方案,无需额外执行轨迹或单独的信用分配模型。这会产生可解释的每个元素的优势和更精确的策略更新。实验表明,EAGLE-GRPO 在达到稳定水平之前可以通过更多的训练步骤保持性能提升,并生成比竞争性 VLM 提示编写基线更高质量的电子商务图像的提示。