论文

答案级别的分布对齐游戏 微调

Distributional Alignment Games for Answer-Level Fine-Tuning

模型训练强化学习

摘要

我们关注 \emph{Answer-Level 微调} (ALFT) 问题,其目标是基于最终答案的正确性或属性来优化语言模型,而不是用于生成它们的特定推理轨迹。由于需要边缘化巨大的潜在推理路径空间,直接优化答案级目标在计算上是很困难的。为了克服这个问题,我们提出了一个通用的博弈论框架,将问题提升为\emph{分布对齐博弈}。我们将 ALFT 制定为策略(生成器)和目标(辅助分布)之间的两人游戏。我们证明该博弈的纳什均衡与原始答案级优化问题的解完全对应。这种变分视角将棘手的边缘化问题转化为易于处理的投影问题。我们证明该框架统一了最新的多样性和自我改进(一致性)方法,并提供与组相对策略优化(GRPO)兼容的高效算法,例如 Coherence-GRPO,在数学推理任务中产生显着的复杂性增益。