论文
OuroReward:文生3D强化学习的顺序奖励调度
OuroReward: Sequential Reward Scheduling for Reinforcement Learning in Text-to-3D Generation
摘要
文生3D(T23D)的强化学习需要优化语义对齐和纹理清晰度等多个质量维度。现有方法通常聚合多个奖励同时优化,没有显式建模维度间依赖,可能导致优化失衡和冲突维度间持续干扰。我们提出OuroReward,一种干扰感知的顺序奖励调度策略。它先估计维度两两依赖,构建累计干扰最小的循环优化路径;加入尾到头依赖,使循环捕捉整个调度的全局兼容性。随后将循环转成一次遍历的序列,从总干扰最低的维度开始。训练不为各维度奖励分配固定预算,而是依据当前奖励剩余改善空间,自适应决定何时转入下一奖励。我们进一步提出AdaSelect,识别与模型当前能力匹配、可靠且有信息量的提示,将策略更新集中在这些提示上以提高训练稳定性。在不同T23D模型与强化学习算法上的广泛实验显示,框架持续改善多个维度的生成质量。