论文

UCPO:不确定性感知的策略优化

UCPO: Uncertainty-Aware Policy Optimization

模型训练强化学习RLVR

摘要

构建值得信赖的大语言模型(LLM)的关键在于赋予它们固有的不确定性表达能力,以减轻限制其高风险应用的幻觉。然而,现有的 RL 范式(例如 GRPO)经常因二元决策空间和静态不确定性奖励而遭受优势偏差,从而导致过度保守或过度自信。为了应对这一挑战,本文揭示了当前结合基于不确定性的奖励的强化学习范式中奖励黑客和过度自信的根本原因,在此基础上我们提出了不确定性感知策略优化(UCPO)框架。 UCPO 采用三元优势解耦来分离并独立标准化确定性和不确定性推出,从而消除优势偏差。此外,引入动态不确定性奖励调整机制,根据模型演化和实例难度实时校准不确定性权重。数学推理和一般任务的实验结果表明,UCPO有效解决了奖励不平衡问题,显着提高了模型超出知识边界的可靠性和校准性。

UCPO:不确定性感知的策略优化
图1:不确定性对齐中奖励失衡示意:静态奖励会引发过度自信或回避退化,而 UCPO 通过自适应校准稳定策略。