论文

迭代微调大多是幂等的

Iterative Finetuning is Mostly Idempotent

模型评测模型行为与机制分析

摘要

如果一个模型具有某种行为倾向,例如谄媚或不对齐,并且用其自身输出进行训练,这种倾向会在下一代模型中被放大吗?我们通过训练一系列模型来研究这一问题:每个模型在其前驱模型生成的数据上微调,而初始模型被注入某种人格或信念。我们测试三种设置:对instruct模型的监督微调(SFT)、对base模型的合成文档微调(SDF),以及直接偏好优化(DPO)。在SFT和SDF设置中,特征大多衰减或保持不变,因此进一步的微调循环不起作用。在少数发生放大的情形中,放大通常以连贯性为代价。在DPO设置中,当模型在偏好其自身输出的条件下持续训练时,特征放大可以可靠地发生;但如果每个循环都重新初始化模型,放大则会消失。总体而言,我们的结果表明放大最可能来自持续的后训练,限制这一阶段可能是一种有效的防御手段。对于非强化学习的微调,特征放大很罕见且对数据量非常敏感,因此意外发生的可能性显著更低。最后,放大与连贯性之间的权衡构成了对抗特征放大的天然抑制机制。

迭代微调大多是幂等的:论文配图
图1:模型在自身输出上迭代训练时,特质通常衰减或保持不变,少数情况下会放大;各面板以Qwen 3模型的bliss特质展示这三种结果。