论文

生成模型自循环训练与用户偏好的共同演化

Self-Consuming Generative Models with Co-Evolving Human Preferences

模型训练模型评测偏好优化合成数据模型行为与机制分析

摘要

生成模型越来越多地在自消耗迭代循环中进行训练,其中用户从模型生成的候选者中挑选首选样本,并使用精选的样本来训练模型的未来几代。先前的工作在很大程度上假设了固定的用户偏好,但在实践中,模型输出的暴露逐渐重塑了用户认为所需的内容,从而创建了模型分布和用户偏好共同演化的反馈循环。我们朝着理解这种耦合动态的长期行为迈出了第一步。我们表明,当训练完全依赖于用户管理的合成数据时,迭代管理会放大初始偏差,并驱动系统走向多个单例平衡之一,在该平衡中,拥有初始优势的实例最终占据主导地位。相比之下,以足够大的速率将参考数据注入训练中会从根本上改变动态并产生独特的全局吸引平衡。基于这一见解,我们研究了如何使用参考数据注入来控制长期结果,并提出了一种 有效的算法,联合选择参考分布及其混合权重,以引导耦合系统达到平衡,从而保留所需的属性,同时最小化数据收集成本。

生成模型自循环训练与用户偏好的共同演化:论文原图
图 1:模型-用户耦合动态概述。第一行(模型更新):当前模型 ptp_{t} 生成 KK 候选者,其中一个通过偏好引导的 KK 方式 Luce 选择保留;精选集 𝒟cur\mathcal{D}_{\mathrm{cur}} 以速率 η\eta 与参考数据集 𝒟ref\mathcal{D}_{\mathrm{ref}} 混合,形成 𝒟t\mathcal{D}_{t},并在其上训练 pt+1p_{t+1}。底行(偏好更新):用户通过奖励 rt(x)=⟨wt,φ⁡(x)⟩r_{t}(x)=\langle w_{t},\varphi(x)\rangle 评估每个候选者如何与当前偏好 wtw_{t} 对齐,其中 φ\varphi 是特征图,然后偏好向量向平均特征方向漂移更新后的模型的 φ¯(pt+1)\bar{\varphi}(p_{t+1})。