外部指导何时有助于 LLM 推理?指导增强 GRPO 的偏差与方差理论
When Does External Guidance Help LLM Reasoning? A Bias-Variance Theory of Guidance-Augmented GRPO
摘要
具有可验证奖励的强化学习(RLVR)已成为大语言模型中引发多步骤推理的主导范式,最近的一波方法(LUFFY、ExPO、PAPO、TAPO)进一步通过 外部指导(专家痕迹、自我解释或检索思维模式)增强了 RL。尽管每种方法都报告了经验收益,但没有一种方法提供收敛率、偏差界限或指导信号的最佳加权规则。我们用 Guidance-Augmented GRPO (GA-GRPO) 缩小了这一差距,这是一个统一的理论框架,它将外部指导作为随机指导算子 G 重写问题分布,并将所得的策略-梯度估计器分析为有偏差的 同策略估计器,其偏差由指导增强采样分布与策略自身分布之间的总变差指导散度 delta\_G 界定。该框架将普通 GRPO、LUFFY、ExPO、PAPO 和 TAPO 视为通过 G 的特定选择获得的特殊情况。在平滑性和有界散度假设下,我们证明 GA-GRPO 以 O(1/sqrt(T)) 速率收敛到 GRPO 驻点的 O(delta sqrt(T)) 邻域,导出闭合形式 MSE 最优指导权重 lambda-star(T, delta, sigma\_0 squared) = sigma\_0 squared / (sigma\_0 squared + R\_max squared delta squared T),并证明匹配的极小极大下界表明 Omega(delta squared T) 偏差项是不可避免的。在 Qwen2.5-Math-7B-Base 上跨九个数学和 OOD 基准的实验证实,最佳权重 GA-GRPO 匹配或超过 TAPO、LUFFY、ExPO 和 vanilla GRPO,同时需要的 GPU 小时减少 31%,并且八个分析实验验证了每个理论预测。
