论文
MASS-DPO:用于直接策略优化的多负主动样本选择
MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization
摘要
Plackett-Luce (PL) 模型下的多负面偏好优化通过利用一个首选响应和多个拒绝响应之间的比较信号来扩展直接偏好优化 (DPO)。然而,对大型负池进行优化成本高昂,并且许多候选者由于 同策略 更新的类似效果而贡献冗余梯度。我们引入了 MASS-DPO,这是一种多负主动样本选择方法,该方法派生出 PL 特定的 Fisher 信息目标,用于在每个提示中选择紧凑、信息丰富的负子集。由此产生的对数行列式目标选择为策略更新提供补充信息的负数,产生保留完整池信息同时减少冗余的紧凑子集。在实践中,这有利于梯度覆盖不同更新方向的负样本,减少来自接近重复候选者的冗余信号,同时保留最有用的训练信息。在涵盖推荐和多项选择 QA 的四个基准以及三个模型系列中,MASS-DPO 在准确性方面始终超过或匹配现有方法,改进了召回率/NDCG 和基于边际的优化动态,并提供了更强的一致性和显着更少的负面结果。