论文

随机性难以击败:使用现代 LLM 在线 DPO 中的主动选择

Random Is Hard to Beat: Active Selection in online DPO with Modern LLMs

模型训练偏好优化

摘要

现代 LLM 继承了网络规模预训练的强大先验,这可能限制 后训练 数据选择策略的空间。虽然主动偏好学习 (APL) 寻求优化在线直接偏好优化 (DPO) 中的查询效率,但 同策略 候选池固有的丰富性通常使简单的随机采样成为令人惊讶的强大基线。我们利用奖励模型和 LLM 作为法官代理,在无害性、有用性和遵循指令设置方面评估基于不确定性的 APL 与随机性。我们发现,与随机相比,APL 在代理获胜率方面的改善可以忽略不计。至关重要的是,我们观察到一种分离,即即使按标准基准衡量的一般能力下降,胜率也会提高。 APL 未能比随机抽样更好地缓解这种能力崩溃或减少方差。我们的研究结果表明,在强预训练先验的情况下,主动选择的计算开销很难证明与简单随机样本提供的“廉价多样性”相比是合理的。我们的代码可在 https://github.com/BootsofLagrangian/random-vs-apl 获取。