论文
GDB-Reward:从评估指标到平面设计训练奖励
GDB-Reward: From Evaluation Metrics to Training Rewards for Graphic Design
摘要
文本到图像模型擅长自然图像合成,但在图形设计方面却很困难,图形设计的成功取决于满足排版、布局、颜色和视觉传达的精确约束。虽然提示优化为昂贵的扩散模型 微调 提供了一个有吸引力的替代方案,但冻结图像生成器的学习提示需要信息丰富的奖励函数,尽管生成过程完全不可微分。强化学习不需要可微的目标;它只需要能够对候选输出进行排名的标量奖励。这就提出了一个简单的问题:设计评估指标本身可以成为强化学习奖励吗?我们的核心贡献是 GDB-Reward,一个系统地将异构图形设计评估指标转化为统一的强化学习奖励的框架。实验表明,GDB-Reward 提供了有效的优化目标,显着提高了感知质量、渲染保真度和空间精度方面对设计规范的遵守程度,同时保持图像生成器完全冻结。更广泛地说,我们的结果表明,异构的、不可微的评估指标可以超越被动基准测试,成为在可微监督不可用的领域中强化学习的有效优化目标。