论文
微调 LLM 具有双重自适应权重的基于团队的自我游戏
Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs
摘要
虽然最近的自我训练方法减少了对对齐 LLM 的人类标记数据的依赖,但它们仍然面临关键的限制:(i)对合成数据质量的敏感性,导致迭代训练中的不稳定和偏差放大; (ii) 由于连续训练迭代中正面和负面响应之间的差距不断缩小而导致优化无效。在本文中,我们提出了具有双重自适应权重(TPAW)的基于团队的自我对弈,这是一种新颖的自我对弈算法,旨在改善完全自我监督的环境中的对齐。 TPAW采用基于团队的框架,当前策略模型与历史检查点既协作又竞争,促进更稳定、更高效的优化。为了进一步增强学习,我们设计了两种自适应加权机制:(i)调整目标响应重要性的响应重新加权方案,以及(ii)在训练期间动态调节每个团队成员的贡献的玩家加权策略。 TPAW 从 SFT 模型初始化,迭代地改进对齐,而不需要额外的人工监督。实验结果表明,TPAW 在各种基本模型和 LLM 基准测试中始终优于现有基准。我们的代码可在 https://github.com/lab-klc/TPAW 上公开获取。