论文

面向语言模型稳定策略优化的反事实自我提问

Counterfactual Self-Questioning for Stable Policy Optimization in Language Models

模型训练偏好优化

摘要

关于语言模型自我改进的近期工作表明,模型可以通过反思、验证、辩论或自我生成的奖励来改进自身推理。然而,大多数现有方法依赖外部批评者、学习到的奖励模型或集成采样,这增加了复杂性并带来训练不稳定。我们提出反事实自我提问(Counterfactual Self-Questioning),一个由单个语言模型生成并评估针对自身推理的反事实批评的框架。该方法先生成一条初始推理轨迹,再构思质疑潜在失败点的针对性问题,然后生成暴露错误假设或无效步骤的替代推理轨迹。这些反事实轨迹提供结构化的相对反馈,无需辅助模型即可直接用于策略优化。在多个数学推理基准上的实验表明,反事实自我提问提高了准确率与训练稳定性,对较小的模型尤其如此,使仅凭内部生成的监督即可实现可扩展的自我改进。

面向语言模型稳定策略优化的反事实自我提问 配图
图 1:Counterfactual Self-Questioning(CSQ)概览。基础策略生成一条初始推理轨迹。反事实自我提问产生暴露失败模式的替代轨迹。这些轨迹被用作相对反馈,通过 GRPO 进行策略优化。