论文
POCA:视觉文本生成的帕累托最优课程调整
POCA: Pareto-Optimal Curriculum Alignment for Visual Text Generation
摘要
当前的视觉文本生成模型在文本准确性和整体图像连贯性之间进行权衡。我们发现,实现高文本准确性会降低审美质量和指令遵循能力。尽管强化学习方法可以通过与多个奖励对齐来缓解问题,但它们对于文本生成通常不稳定,因为现有方法通常以加权和的方式优化多个奖励。另外,很难平衡各个奖励的权重。此外,强化学习需要一套训练指令。大量的提示需要更多的训练时间和计算资源,而少量的提示会导致性能较差。因此,如何选择有效训练的提示是一个尚未解决的问题。在本研究中,我们提出了帕累托最优课程调整(POCA),这是一个框架,通过以下方式解决这个问题作为多目标问题:1)识别帕累托最优集以避免简单的标准化;2)设计自适应课程调整策略来使用自动难度评估来管理多奖励数据集的学习序列,这对于强化学习方法在有限数据环境中探索时的最佳收敛至关重要。在协同作用中,POCA 在统一的奖励空间中找到帕累托最优集,从而消除不一致的信号,从而在由易到难的优化环境下从不同的奖励中找到最佳的权衡解决方案。实验结果表明,POCA 显着提高了 CLIP、HPS 分数和句子准确性等所有指标。