论文
配电桥采样、自我奖励 RL 和自我 蒸馏
Power Distribution Bridges Sampling, Self-Reward RL, and Self-Distillation
摘要
最近的分析质疑强化学习 (RL) 是否负责 大语言模型 (LLM) 中的强推理。与此同时,蒸馏 和推理时间采样(包括功率采样)已成为提高 LLM 性能的有效方法。然而,RL、蒸馏 和采样之间的关系仍不清楚。在本研究中,我们重点关注功率分布、功率采样的目标分布,并表明功率分布桥接采样、自奖励 KL 正则化 RL 和自 蒸馏。从采样的角度来看,我们表明,如果没有有关可能后缀的信息,廉价的局部近似无法重现序列级功效。从强化学习的角度来看,当模型的序列级对数概率用作奖励时,功率分布是 KL 正则化强化学习的封闭式优化器。这种识别导致了 power self-蒸馏,一个离线 蒸馏 代理,它共享相同的目标分布,并将功率采样的成本摊销到教师样本的监督训练中。我们进一步表明,权力 self-蒸馏 可以实现自我奖励锐化,而下游真实奖励的提高由权力分配下真实奖励和自我奖励之间的协方差控制。推理任务的实验支持了我们的分析:功率采样提高了自我奖励,真实奖励增益取决于与自我奖励的一致性,功率自我 蒸馏 可以以低得多的推理成本匹配或超过功率采样的性能。