论文
AGPO:面向可验证推理与京东搜索广告相关性的非对称组策略优化
AGPO: Asymmetric Group Policy Optimization for Verifiable Reasoning and Search Ads Relevance at JD
摘要
可验证奖励的强化学习(RLVR)在提升LLM推理性能上成效显著。但近期研究揭示:当前RLVR方法虽提高向正确路径的采样效率,却未激发根本新的推理模式;训练后模型的能力边界常较基座变窄——大样本下基座覆盖率更高。为此我们提出非对称组策略优化(AGPO)以对抗这种边界收缩。AGPO采用负主导强化策略抑制错误推理路径,保持基座模型的探索容量。正向强化上,AGPO采用组优势机制:按组内方差缩放正向更新,使模型聚焦稀有正确路径、抑制平凡路径的更新。在五个数学基准上的实验显示AGPO取得SOTA准确率,且在大样本pass@k上一致改进。在京东搜索广告相关性优化的大规模工业应用中,AGPO有效提升数据标注质量,为下游学生模型带来可观性能增益。
