论文
SPEAR:通过强化学习中的顺序符号对齐提炼领域自适应推理骨架
SPEAR: Distilling Domain-Adaptive Reasoning Skeletons via Sequential Symbolic Alignment in Reinforcement Learning
摘要
基于强化学习的 知识蒸馏 有潜力将复杂的推理从教师模型转移到学生模型,但它目前面临着一个关键的困境:研究人员必须在稀疏的基于结果的奖励(其提供的逻辑指导不足)和昂贵的神经过程奖励模型(PRM)之间进行选择,该奖励模型用于密集信号。我们通过引入 SPEAR(符号过程评估和对齐奖励)来解决这个问题,这是一种 无需训练 和用于序列级 同策略 蒸馏 的即插即用过程奖励方法。 SPEAR 将自然语言推理轨迹投射到领域自适应符号里程碑中,为流程级推理对齐提供有效的代理。通过利用最长公共子序列 (LCS) 将学生的探索与教师的里程碑保持一致,SPEAR 提供了密集的、顺序感知的奖励信号,无需外部神经验证器即可强制执行逻辑一致性。我们在数学、科学和常识推理任务方面的实验表明,SPEAR 通过序列级 蒸馏 和高效密集的过程奖励,有效地弥合了学生和教师模型之间的推理差距。我们的代码和数据可以在:https://github.com/zhuochunli/SPEAR 获取。