论文

PBSD:用于长期贡献分配的特权贝叶斯自我 蒸馏

PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment

模型训练奖励建模与过程监督

摘要

长期代理任务对基于结果的强化学习提出了基本的贡献分配挑战:轨迹级奖励验证了最终的正确性,但对于哪些中间推理步骤或工具交互对结果有贡献提供了有限的指导。这一困难在多轮搜索代理中尤其明显,其中成功的轨迹可能包含误导性的行为,而失败的轨迹可能包含有价值的证据收集步骤。我们提出了 PBSD(特权贝叶斯自 蒸馏),这是一种贝叶斯校准的自 蒸馏 方法,用于稀疏最终奖励下的细粒度贡献分配。 PBSD 通过验证答案的后验概率与先验概率比来衡量轨迹质量,并应用贝叶斯规则将这种难以估计的答案侧比率转换为标准学生模型和特权答案条件教师模型之间易于处理的似然比。该贝叶斯证据评分的自回归分解会产生轮次级别信号,该信号可识别每个中间轮次是否支持或破坏已验证的结果。因此,PBSD 提供了一种有原则且优雅的重新加权方案,将稀疏结果监督转化为贝叶斯校准的轮级信用信号,同时保持与标准策略优化完全兼容。实验表明,PBSD 持续增强域内和域外设置的性能,并有效地将知识从短上下文训练转移到长上下文推理,这表明其细粒度的贡献分配机制有助于更有效的政策学习并提高泛化能力。