论文

CommerceVibe:学习通过双反馈强化学习将电子商务创意设计为可执行的视觉代码

CommerceVibe: Learning to Design E-Commerce Creatives as Executable Visual Code via Dual-Feedback Reinforcement Learning

模型训练强化学习

摘要

高质量的电商创意对于展示产品和传达营销信息至关重要。最近的扩散模型可以实现可扩展的创意生成并生成视觉上引人注目的图像,但其扁平化的光栅输出通常包含扭曲的文本和不一致的产品细节,需要在部署之前进行细化。此外,如果没有明确的结构,生成的创意就很难编辑和重用,而复杂的设计要求仍然难以编码为可验证的训练信号。为了应对这些挑战,我们推出了 CommerceVibe,它将创意表示为可执行的视觉代码,并将生成制定为条件 HTML/CSS 程序合成。给定产品图像、设计要求和产品信息,它会生成可渲染、可编辑和可重复使用的创意。我们进一步引入了双反馈强化学习,其中基于规则的反馈评估渲染程序的文本可读性、产品可见性和布局有效性,而来自视觉语言模型(VLM)的视觉反馈则根据六个感知和商业维度的输入规范评估渲染的创意。这些互补的反馈信号共同提高了约束满意度和感知相关的质量。我们在超过 28,000 个电子商务示例上执行 Qwen3.5-9B 的有监督 微调 (SFT),然后进行双反馈强化学习。在 1,300 个案例的基准测试中,优化后的 CommerceVibe 模型的加权得分为 94.0/100,而仅 SFT 变体的加权得分为 87.3,并且优于强大的外部模型。五位电商设计专家的盲评进一步验证了这些改进。 CommerceVibe支持可控、可编辑、可扩展的电商创意制作。