论文
Know What You Know:面向可验证 RL 推理的元认知熵校准
Know What You Know: Metacognitive Entropy Calibration for Verifiable RL Reasoning
摘要
大型推理模型(LRM)已成为解决复杂现实任务的强大范式。实践中,这些模型主要通过可验证奖励的强化学习(RLVR)训练,但多数现有的仅结果 RLVR 流水线几乎完全依赖二元正确性信号,基本忽视模型固有的不确定性。我们将这种错位称为不确定性-奖励错配:高不确定性与低不确定性的解被等同对待,阻碍策略“Know What You Know”,也妨碍从优化正确答案转向优化有效推理路径。这一局限在数学与问答等以推理为中心的任务中尤为关键,因为表现取决于模型内部推理过程的质量,而非对最终答案的死记硬背。为此,我们提出 EGPO,一个元认知熵校准框架,将固有不确定性显式整合进 RLVR 以增强 LRM。EGPO 使用从 token 级似然导出的零开销熵代理估计每样本不确定性,并通过非对称校准机制将其与外部正确性对齐:在保留正确推理的同时选择性地调节过度自信的失败,从而实现稳定且不确定性感知的策略优化。此外,EGPO 无需修改验证器或奖励定义,即可从原本退化的分组 rollout 中恢复有用的学习信号。跨多个基准的大量实验表明,所提 EGPO 带来可观且一致的推理性能提升,为通过元认知熵校准推进 LRM 奠定有原则的路径。
