论文
核化优势估计:从非参数统计到 LLM 推理
Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning
摘要
大语言模型 (LLM) 的最新进展越来越依赖强化学习 (RL) 来提高其推理能力。三种类型的方法已被广泛采用:第一种方法依靠深度神经网络来估计学习策略的价值函数,以减少策略梯度的方差。然而,估计和维护这样的价值网络会产生大量的计算和内存开销。第二个避免通过使用样本平均值来近似价值函数来训练价值网络。然而,它会根据每个提示对大量推理轨迹进行采样,以实现精确的值函数近似,从而导致计算成本高昂。第三种方法对每个提示仅采样一个推理轨迹,这降低了计算成本,但采样效率较差。本文重点关注一种实用的、资源受限的环境,其中每个提示只能对少量推理轨迹进行采样,而低方差梯度估计对于高质量的策略学习仍然至关重要。为了应对这一挑战,我们将计算和统计上均高效的经典非参数统计方法引入到 LLM 推理中。我们采用核平滑作为价值函数估计和后续策略优化的具体示例。数值和理论结果表明,我们的建议实现了准确的价值和梯度估计,从而改进了策略优化。