论文
AGPO:具有双重统计反馈的自适应组策略优化
AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback
摘要
强化学习改进了 LLM 推理,但 PPO/GRPO 通常使用固定的削波和解码温度,这使得训练变得脆弱且调整繁重。我们提出自适应组策略优化(AGPO),这是对 GRPO 的无批评细化,它使用组级统计数据来控制更新幅度和探索。 AGPO 使用共享探针导出的统计状态来驱动两个控制器:(i)自适应裁剪,它根据奖励离散度和偏度、探针投票熵、策略熵和逐步 KL 漂移来设置信任区域大小; (ii) 双向自适应温度采样,根据相对于运行基线的中心不确定性在基本温度附近加热或冷却解码。在九个英语和中文数学/STEM 基准测试中,使用 AGPO 训练的 Qwen2.5-14B 在相同生成的 词元预算 下优于 PPO/GRPO,在 GSM8K 上达到 67.3%,在 MATH 上达到 40.5%。增益转移到 Llama-3-8B 和 Gemma-2-9B,并且消融确认这两个模块是互补的。我们的实现可在 https://github.com/wandugu/paper_agpo 上公开获取。