论文

EAPO:面向开放式问答策略优化的熵驱动正负样本自适应加权

EAPO: Entropy-Driven Adaptive Positive-Negative Sample Weighting for Policy Optimization in Open-Ended QA

模型训练强化学习

摘要

大型推理模型通常通过可验证奖励的强化学习(RLVR)进行训练。然而,现有方法对正样本和负样本采用固定权重,其结论难以泛化到开放式问答(QA)。本文系统研究了开放式问答强化学习中正样本与负样本的作用。我们提出一种基于奖励均值的正负样本判别策略,并观察到负样本主要决定回复多样性与性能上限,而正样本主要决定回复质量与收敛稳定性。基于这些观察,我们提出EAPO,一种熵驱动的自适应策略优化方法,它根据当前策略熵与初始熵之比自适应地计算正样本的加权系数。在熵下降阶段,分配给正样本的权重被降低以保持探索;在熵上升阶段,权重被放大以强化稳定性,从而缓解熵坍缩。在两个公开的开放式医疗问答数据集上的实验表明,EAPO在回复多样性和稳定性两方面均持续且显著优于固定权重基线。