论文

精选的合成数据不必崩溃:具有多元偏好的生成再训练的理论研究

Curated Synthetic Data Doesn't Have to Collapse: A Theoretical Study of Generative Retraining with Pluralistic Preferences

模型训练合成数据

摘要

生成模型的递归再训练提出了关键的表示挑战:当基于固定奖励信号来策划合成输出时,模型往往会崩溃到过度优化该目标的狭窄输出集。先前的研究表明,如果不添加真实数据,这种崩溃是不可避免的。我们从对齐的角度重新审视这个结论,并表明可以通过基于多种奖励函数的管理来减轻崩溃。我们形式化了异构偏好下递归训练的动态,并证明在某些条件下,模型收敛到一个稳定的分布,该分布在竞争的高奖励区域之间分配概率质量。限制分布保留了多样性,并可证明满足加权纳什讨价还价解决方案,为综合再训练循环中的价值聚合提供了正式解释。