论文
DynamicPO 缓解推荐偏好优化中的负样本坍缩
DynamicPO: Dynamic Preference Optimization for Recommendation
摘要
在基于大语言模型的推荐系统中,直接偏好优化(DPO)能够将推荐结果与用户偏好对齐。为利用丰富的隐式反馈负样本、明确偏好边界,通常采用多负样本目标函数。然而,实证分析发现一种反直觉现象:即使训练损失持续下降,增加负样本数量仍可能使性能退化,形成“偏好优化坍缩”。理论分析表明,其原因是梯度抑制:容易区分的负样本压过真正决定用户偏好边界的关键负样本,使边界相关信号优化不足,削弱决策边界。为此,我们提出轻量、即插即用的DynamicPO,包含两种自适应机制:动态边界负样本选择,识别并优先使用决策边界附近的信息量高的负样本;双间隔动态β调节,根据边界模糊程度校准每条样本的优化强度。三个公开数据集的广泛实验表明,DynamicPO能够防止优化坍缩,改善多负样本偏好优化方法的推荐准确率,且额外计算开销可忽略。代码与数据集见https://github.com/xingyuHuxingyu/DynamicPO。
