论文

为什么语义熵失败:策略优化的几何感知和校准不确定性

Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization

模型训练强化学习

摘要

后训练 已成为改进 大语言模型 推理和对齐的核心,其中无批评模型可以从模型生成的输出中进行可扩展学习,但缺乏区分信息信号和噪声信号的原则机制。最近的方法利用响应水平测量作为不确定性信号来调节基于组的优化方法,例如 GRPO。然而,他们的经验成功仍然不稳定,并且不清楚他们如何影响优化动态。在本文中,据我们所知,我们提供了第一个原理公式,将不确定性信号解释为表征和调节梯度方差以及学习信号质量的机制。基于经验和理论分析,我们确定了当前基于熵的估计器的两个关键差距:各向异性差距和校准差距。受此分析的启发,我们提出了几何感知校准策略优化(GCPO),这是一种集成几何感知措施的新颖框架,用于捕获语义分歧与基于奖励的校准,从而使不确定性与学习信号强度保持一致。多个基准测试的实验表明,我们的方法更忠实地跟踪梯度变化并持续改进 后训练 性能。我们的结果强调了设计与优化动态相一致的不确定性信号的重要性,为稳健的 后训练 提供了原则性的视角。