论文
SocraticPO:通过交互式指导进行政策优化
SocraticPO: Policy Optimization via Interactive Guidance
摘要
大语言模型 的强化学习 (RL) 通常使用标量结果奖励(例如二进制正确性)来监督推理。这种奖励提供了优化方向,但很少解释模型应该如何修正其错误推理,这可能会鼓励捷径学习和脆弱的政策。我们提出 \textbf{SocraticPO} (苏格拉底策略优化),这是一个策略优化框架,通过苏格拉底式自然语言指导来增强 RL 的执行轨迹。在执行轨迹过程中,学生首先独立回答;如果答案不正确,老师会诊断尝试并提供简洁的纠正指导,然后学生在扩展的背景下继续。至关重要的是,这种指导与奖励衰减相结合:教师干预后获得的正确答案只能获得衰减的奖励,从而防止该政策将教师的帮助视为获得奖励的免费途径。由于 SocraticPO 仅修改执行轨迹过程,同时保持标准预期奖励目标不变,因此它可以插入现有的策略梯度后端,例如 Reinforce++。此外,由于教师仅提供文本级指导,SocraticPO 可以利用更强大的黑盒教师模型,而无需访问 logits 或分布匹配。在 SciKnowEval 的本科水平科学推理基准上,SocraticPO 比强大的 RL 和自我 蒸馏 基线有所改进。消融表明,有针对性的指导和奖励衰减都是必要的,奖励衰减减轻了对辅助纠正的依赖。