论文
后训练 处于可检测性边缘:微调 的博弈论方法
Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning
摘要
强化学习 (RL) 微调 在语言 模型训练 中广泛使用,以提高目标任务的性能,同时限制参考策略的偏差。平衡这种权衡的标准方法是通过 KL 正则化 RL 目标,尽管该公式本身并没有提供设置正则化系数的原则方法。在实践中,通常通过启发式或通过超参数搜索来选择系数,这可能会导致不必要的训练成本开销或不良的奖励保留权衡。相反,我们提出了一个博弈论框架,为这种权衡提供了明确的统计解释。具体来说,我们研究了一个顺序博弈,其中代理选择一个策略来最大化累积奖励,而监视器则随着时间的推移观察策略输出并测试与参考策略的偏差。尽管并非出于相同的角度,但我们表明,所得到的均衡策略仍然可以表示为 KL 正则化 RL 问题的最优正则化参数的解决方案,该参数可以被视为最大化每单位统计可区分性的奖励。借鉴凹凸分数规划的经典结果,我们提供了一种通过简化为 KL 正则化 RL 目标来学习此平衡系数的原理方法,从而允许灵活集成到标准 微调 管道中。在 Qwen3-8B 和 Llama-3.2-1B 的实验中,我们表明我们的方法会在持续学习的环境中导致竞争性奖励保留权衡,并说明我们的框架如何用于审核服务于开源模型的 API 提供商。