论文

满足动态的个人偏好:通过配对 微调 解决人类价值冲突

Meet Dynamic Individual Preferences: Resolving Conflicting Human Value with Paired Fine-Tuning

模型训练偏好优化

摘要

大语言模型 (LLM) 的最新进展显着改善了模型与一般人类偏好的一致性。然而,如何使 LLM 适应个人偏好仍然是一个重大挑战,这些偏好不仅是多样化的,而且是动态的。在本文中,我们介绍了一种新颖的框架,即偏好配对 微调 (PFT),旨在将模型与矛盾且不断变化的个人偏好结合起来。我们提出了一个新的数据集,价值冲突困境(VCD),其中包括涉及人类偏好冲突的场景,有助于评估我们的方法。我们的实验表明,PFT 优于单偏好训练方法,在多选择分类任务中实现高达 96.6% 的准确率,最高开放式生成分数为 8.69。 PFT 还显示出相对于 DPO、SFT 和一些传统训练方法的显着改进,特别是在处理冲突的偏好时。此外,在用户历史数据有限的情况下,模型可以快速推断偏好向量,与单偏好模型相比,用户特定偏好对齐提高了 44.76%。