论文
生成模型自循环训练与用户偏好的共同演化
Self-Consuming Generative Models with Co-Evolving Human Preferences
摘要
生成模型越来越多地在自消耗迭代循环中进行训练,其中用户从模型生成的候选者中挑选首选样本,并使用精选的样本来训练模型的未来几代。先前的工作在很大程度上假设了固定的用户偏好,但在实践中,模型输出的暴露逐渐重塑了用户认为所需的内容,从而创建了模型分布和用户偏好共同演化的反馈循环。我们朝着理解这种耦合动态的长期行为迈出了第一步。我们表明,当训练完全依赖于用户管理的合成数据时,迭代管理会放大初始偏差,并驱动系统走向多个单例平衡之一,在该平衡中,拥有初始优势的实例最终占据主导地位。相比之下,以足够大的速率将参考数据注入训练中会从根本上改变动态并产生独特的全局吸引平衡。基于这一见解,我们研究了如何使用参考数据注入来控制长期结果,并提出了一种 有效的算法,联合选择参考分布及其混合权重,以引导耦合系统达到平衡,从而保留所需的属性,同时最小化数据收集成本。
