论文

解释质量评估作为列表奖励排名

Explanation Quality Assessment as Ranking with Listwise Rewards

模型训练奖励建模与过程监督

摘要

我们将解释质量评估重新表述为排名问题而不是生成问题。我们不是优化模型来逐个生成单个“最佳”解释,而是训练奖励模型来区分多个候选解释并了解它们的相对质量。具体来说,我们构建具有分级质量水平的每个实例候选集,并训练列表和成对排序模型(ListNet、LambdaRank、RankNet)以保留序数结构并避免点式回归或二元偏好目标典型的分数压缩。我们观察到三个发现:首先,在所有测试领域中,排名损失在分数分离方面始终优于回归。其次,最佳排名损失取决于数据特征:列表目标在良好分离的质量层中表现出色,而成对方法对于嘈杂的自然注释更加稳健。第三,当使用精心策划和结构良好的数据进行训练时,小型编码器模型可以匹配大几个数量级的模型,这表明数据质量比模型规模更重要。最后,当用作策略优化中的奖励时,基于排名的分数可以在基于回归的奖励完全失败的情况下实现稳定的收敛。代码和数据可访问:https://github.com/Tankiit/PPO_Learning_to_rank