论文
超越均值:用于LLM推理的多矩策略优化
Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning
摘要
强化学习已成为大语言模型提升推理能力的中心方法。现有方法通常旨在降低问题上诱导的失败概率。在这篇论文中,我们引入了一种基于均值的视角来优化LLM推理中的策略,将随机采样问题的失败概率视为随机变量,并通过其均值来刻画优化目标。在这种视角下,许多现有方法仅优化失败概率分布的单个均值,而其更广泛的分布结构则未被充分刻画。我们提出了多均值策略优化(MMPO),这是一种新的策略优化框架,同时最小化失败概率分布的多个均值。MMPO允许直接的操作解释,即最小化期望的截断时间,以获得第一个成功的响应。除了MMPO之外,我们进一步发展了一个通用的均值变换框架,该框架系统地诱导不同的均值模式,并为更广泛的策略优化目标提供统一的视角。我们在五个数学推理基准和不同规模的模型上进行实验,结果表明MMPO始终优于强基准。我们希望这种基于均值的视角为LLM推理中的策略优化目标设计提供新的见解。
