论文
强化学习后训练对语言模型组合推理的影响
Compositional Reasoning in Language Models under Reinforcement Learning Post-Training
摘要
组合推理对现实问题求解至关重要:训练数据必然有限,因此模型必须以新的方式组合已学技能来泛化。强化学习等后训练方法虽然显著提升了语言模型的推理能力,但其对组合推理的影响仍缺乏充分理解。我们提出依赖图框架来形式化组合推理,得到复杂度逐级增加的三个组合性层次。在实验中,我们用数据结构任务实例化这一框架,因为这类任务具有确定性的奖励计算和清晰的组合结构。我们发现一种一致的从分解到组合的不对称性:分解技能训练不能可靠地迁移到组合任务,而组合任务训练更容易反向迁移到分解任务。我们为这种不对称性提供理论解释,并进一步在长度外推、结构分布变化以及迁移至需要未见技能的任务等条件下评估组合泛化。最后,我们在真实工具调用基准上开展初步研究,获得这一不对称性可能延伸至实际场景的初步证据。