论文
ACPO:通过模式局部熵代理优化非对称信贷政策
ACPO: Asymmetric Credit Policy Optimization via Mode-Local Entropy Surrogate
摘要
结果监督强化学习可扩展到可验证的推理任务,但轨迹级奖励将相同的结果信号分配给所有采样的标记,而忽略了它们对推理过程的不平等贡献。熵提供了模型决策状态的自然指标,但将其用于 词元级 信用分配会带来两个关键挑战:大词汇表中的长尾概率会破坏熵值和梯度,而不确定性在积极和非积极优势轨迹上携带不同的语义。我们提出非对称贡献策略优化(ACPO),它用顶部词元概率的补数代替全局熵作为模式局部代理。在梯度分析的指导下,ACPO 结合了失配路由和饱和度校正,将策略更新形成所需的不对称形式,强调积极轨迹上的不确定决策,同时惩罚失败轨迹上的自信区域。理论上,ACPO 在限制替代误差的同时局部保留了优势方向。数学和编码推理基准(包括 AIME 2025 和 HumanEval Pro)的实验表明,ACPO 始终优于熵感知方法(例如 80/20、GTPO)和强结果监督的 RL 基线(例如 DAPO、SAPO)。