论文
面向语言模型稳定策略优化的反事实自我提问
Counterfactual Self-Questioning for Stable Policy Optimization in Language Models
摘要
关于语言模型自我改进的近期工作表明,模型可以通过反思、验证、辩论或自我生成的奖励来改进自身推理。然而,大多数现有方法依赖外部批评者、学习到的奖励模型或集成采样,这增加了复杂性并带来训练不稳定。我们提出反事实自我提问(Counterfactual Self-Questioning),一个由单个语言模型生成并评估针对自身推理的反事实批评的框架。该方法先生成一条初始推理轨迹,再构思质疑潜在失败点的针对性问题,然后生成暴露错误假设或无效步骤的替代推理轨迹。这些反事实轨迹提供结构化的相对反馈,无需辅助模型即可直接用于策略优化。在多个数学推理基准上的实验表明,反事实自我提问提高了准确率与训练稳定性,对较小的模型尤其如此,使仅凭内部生成的监督即可实现可扩展的自我改进。
