论文
人工筛选何时以及如何适得其反:多模型自消费循环下的偏好对齐
When and How Human Curation Backfires: Preference Alignment under Multi-Model Self-Consuming Loop
摘要
基础模型越来越多地在先前模型迭代生成的合成数据上训练,而非仅使用真实数据。这种自消费训练范式可能导致模型崩溃、发散或偏差放大。近期工作(Ferbach et al., 2024)表明,在循环中引入人工筛选可以引导自消费模型趋向符合人类偏好的行为,但这些分析聚焦于仅消费自身输出的单个孤立模型。然而在实践中,模型常常相互交互,并在其他模型产生的输入-输出对上训练。本文研究多模型情形下的自消费训练。我们首先为相互交互的自消费模型建立形式化框架,并刻画所得动力系统何时收敛到稳定点。随后我们考察对某一模型进行人工筛选如何影响其自身对齐(自影响),以及这种影响如何传播到其他模型(交叉影响)。与孤立场景中人工筛选总能增强模型对齐不同,我们证明跨模型交互可能削弱甚至逆转这一效应,最终损害长期对齐。
