论文
Prospective Hindsight:预测-现实差距的自校准RL
Prospective Hindsight: Self-Calibrating Reinforcement Learning via Prediction-Reality Gaps
摘要
长程智能体的强化学习依赖纯回顾性训练信号:信用只在观察环境后果后分配,梯度看不到行动时智能体的信念。我们提出前瞻后见(PH),一个自校准训练原则:用智能体前瞻预测(反馈前)与回顾性评估(反馈后)之间的差距产生的信号增强任何回顾性基方法。这种逐rollout的惊讶识别智能体自模型最不准的样本,并通过停止梯度的惊讶加权优势放大其梯度贡献。由于前瞻预测器与策略共享参数,两者共同演化,逐步把焦点转向智能体剩余盲区。我们把该原则联系到特权信息差距,证明最小化惊讶残差为智能体误校准率提供下降路径;校准因此作为优化的副产物出现而非附加目标。在单轮可验证任务与多轮个人智能体任务(GRPO、在线蒸馏及其组合)上,PH同时改善任务性能与校准,跨模型规模增益一致。值得注意的是,主导误校准模式在两种状态间结构性转移——单轮的过度自信失败、多轮的欠自信成功——而同一训练原则成功应对两者。