论文
FlowBalance:来自同策略推理经验的基于验证者的自我提升
FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience
摘要
推理模型可以根据自己的 同策略 经验进行改进,但这种内部循环是脆弱的:终端验证者提供可靠但稀疏的监督,而密集的同模型指导可能会强化错误的信心或在狭窄的解决方案模式上过度集中学习。我们引入 FlowBalance,这是一种基于验证者的自我改进方法,可以学习完整响应的归一化分布。对于每个 同策略 轨迹,同一策略的冻结训练时间视图使用特权上下文来产生 词元级 对数概率增益,这些增益被聚合成轨迹级自引导分数。 FlowBalance 使用验证者导出的组优势来校准此分数:在正优势轨迹上保留指导,在负优势轨迹上反转指导,并在轨迹采样组不提供结果偏好时禁用指导。由此产生的能量以指数方式重新加权参考策略,并且分析的轨迹平衡通过每个轨迹采样组的一个日志分区估计来拟合归一化目标。这通过轨迹平衡实现了结果校准的自我引导,没有单独的 词元级 模仿损失。我们的分析建立了组内对比保留、最小变化反向 KL 表征、目标奖励的单调验证者控制,以及对拒绝响应的假阳性自我指导的精确纠正。在数学推理方面,FlowBalance 提高了 Qwen3-4B 和 Qwen3-8B 上 FlowRL 的平均性能,同时还提高了训练速度和稳定性,避免了直接 OPSD 的响应长度崩溃,并在受控 AIME24 诊断中表现出更高的正确策略多样性。