论文

超越均值:用于LLM推理的多矩策略优化

Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning

模型训练强化学习

摘要

强化学习已成为大语言模型提升推理能力的中心方法。现有方法通常旨在降低问题上诱导的失败概率。在这篇论文中,我们引入了一种基于均值的视角来优化LLM推理中的策略,将随机采样问题的失败概率视为随机变量,并通过其均值来刻画优化目标。在这种视角下,许多现有方法仅优化失败概率分布的单个均值,而其更广泛的分布结构则未被充分刻画。我们提出了多均值策略优化(MMPO),这是一种新的策略优化框架,同时最小化失败概率分布的多个均值。MMPO允许直接的操作解释,即最小化期望的截断时间,以获得第一个成功的响应。除了MMPO之外,我们进一步发展了一个通用的均值变换框架,该框架系统地诱导不同的均值模式,并为更广泛的策略优化目标提供统一的视角。我们在五个数学推理基准和不同规模的模型上进行实验,结果表明MMPO始终优于强基准。我们希望这种基于均值的视角为LLM推理中的策略优化目标设计提供新的见解。

超越均值:用于LLM推理的多矩策略优化:论文配图
图1 :单时刻和多时刻优化示意图。FθF_{\ theta}表示跨越问题的失效概率随机变量, FθiF_{\ theta} ^ {i}表示通过将FθF_{\ theta}提高到第i次幂而获得的随机变量。每条曲线表示FθiF_{\ theta} ^ {i}的概率密度函数,对应的虚线表示其均值为[Fθi]\ mathbb {E} [F_{\ theta} ^ {i}] ,即FθF_{\ theta}的第二矩。 通过共同考虑多个时刻, MMPO捕获了更丰富的结构信息。