论文

响应时间增强了与异构偏好的一致性

Response Time Enhances Alignment with Heterogeneous Preferences

模型训练偏好优化

摘要

将 大语言模型 (LLM) 与人类偏好保持一致通常依赖于将汇总反馈聚合到单个奖励模型中。然而,这种标准方法假设所有贴标者具有相同的基本偏好,忽略了现实世界的贴标者高度异构且通常是匿名的事实。因此,仅仅依赖二元选择数据从根本上扭曲了学习到的策略,使得真正的人口平均偏好无法识别。为了克服这一关键限制,我们证明使用简单的辅助信号(用户的响应时间)来增强偏好数据集可以恢复总体平均偏好的可识别性。通过将每个决策建模为漂移扩散模型(DDM),我们引入了一种新颖的、一致的异质偏好估计器,它成功地纠正了标准仅选择标签的扭曲。我们证明,即使在每个匿名标记者仅贡献一个选择的极端情况下,我们的估计器也渐近收敛于真实的平均偏好。根据经验,在合成数据集和现实世界数据集中,我们的方法始终优于标准基线,否则标准基线会失败并在偏差下限达到稳定水平。由于响应时间本质上是免费记录的,并且需要零用户跟踪或识别,因此我们的结果带来了希望,并为未来的数据收集管道开辟了新的机会,以提高社会效益,而无需用户级标识符或重复诱导。