论文
通过在线联合中的优势加权细化增强自我对弈 LLM 微调
Self-Play Enhancement via Advantage-Weighted Refinement in Online Federated LLM Fine-Tuning
摘要
最近的工作有先进的基于反馈的学习系统,基础模型能够接收传入的反馈(例如,来自用户的反馈)来自我改进,创建一个自循环的训练系统。然而,现有的工作仅限于需要考虑离线设置以允许这种基于反馈的方法,需要特权 真值 上下文进行训练。此外,对联邦学习(FL)的考虑有限,例如,联邦学习特别适合在大型最终用户网络中纳入外部反馈,但需要有效的方法来在资源受限的边缘设备上进行训练。因此,我们引入了 SPEAR(通过优势加权细化的自我游戏增强),这是一种针对联合 LLM 微调 的高效在线学习算法。 SPEAR 利用反馈引导的自我对弈循环来构建每个提示的自然对比对,用于训练模型,其中 (i) 满意完成的标准最大似然性和 (ii) 不满意完成的尾部标记的置信加权不太可能。 SPEAR 仅需要交互级二元满意度信号以及非答案反馈,不需要提供 真值 答案,并且不需要昂贵的组生成,这意味着在线和以资源高效的方式进行训练是可行的。我们在各种基准数据集上验证 SPEAR,证明其与相关基线相比的卓越性能。