论文

GeneralThinker:通过似然引导答案条件优化进行领域一般推理

GeneralThinker: Domain-General Reasoning through Likelihood-Guided Answer-Conditioned Optimization

模型训练强化学习

摘要

具有可验证奖励的强化学习改进了语言模型推理,但其对特定领域验证器、稀疏结果奖励和粗粒度贡献分配的依赖限制了其适用性。我们引入了 GeneralThinker,这是一个 同策略 框架,它将推理监督重新表述为密集答案条件优化,从而无需特定领域的验证器即可实现响应级别评估和 词元级 贡献分配。 GeneralThinker 使用 真值 答案的可能性评估生成的推理轨迹,并导出用于细粒度贡献分配的标记式兼容性信号。为了稳定优化,它通过限幅和方向保持调制来限制 词元级 更新。在涵盖数学、STEM 和一般推理的 11 个基准测试中,GeneralThinker 取得了最佳平均性能。进一步的分析表明,不受控制的 词元级 调制可能会破坏训练的稳定性,而受控调制则可以使细粒度的学分分配始终有效。