论文
IRIS:大语言模型 微调 的插值 Rényi 迭代自我对弈
IRIS: Interpolative Rényi Iterative Self-play for Large Language Model Fine-Tuning
摘要
通过将带注释的响应与自生成的响应进行对比,自我游戏 微调 使 大语言模型 能够超越监督的 微调 进行改进,而无需额外的人工注释。许多现有方法依赖于固定的发散机制。 SPIN 与基于 KL 的机制密切相关,SPACE 与通过噪声对比估计的 Jensen-Shannon 式目标密切相关,SPIF 与 $χ^2$ 正则化自我博弈密切相关。由于这些差异根据模型和目标之间的分布差距表现出不同的强度,因此似乎没有单一选择可以在整个训练阶段提供有利的学习动态。我们提出了 IRIS(Interpolative Rényi Iterative Self-play),这是一个基于 Rényi 的自我对弈 微调 框架,具有连续可调的目标。 IRIS 在注释和合成数据上分解为两个独立的倾斜风险项,指数重要性权重由顺序参数 $α$ 控制。我们表明,几个自我博弈目标可以被解释为特定 $α$ 值的限制或代表性制度,为这些方法提供了统一的理论视角。自适应订单计划进一步调整$α$以适应分布差距,从训练早期更尖锐的重要性权重转变为接近收敛时更平滑的细化。理论上,我们建立了IRIS的定点性质,并分析$α$如何控制梯度浓度。在 Zephyr-7B 和 Qwen2.5-3B 上进行的 10 个基准测试表明,IRIS 在基线上有所提高,平均得分达到 44.57\%,并且在迭代过程中取得了进步。在我们的设置中,只有 26$k$ 带注释样本的 IRIS 超过了在完整 200$k$ 数据集上训练的标准监督 微调。