论文
Rushes:多元对齐的人类偏好数据集
Rushes: A Human Preference Dataset for Pluralistic Alignment
摘要
我们介绍了 Rushes,这是一个数据集和基准,用于研究交互式叙事环境中揭示的人类参与偏好。冲刺是通过游戏界面收集的,用户与人工智能生成的分支叙述进行交互,并在每个决策点从一个小的、明确的候选集中选择一个选项。每次交互都会记录完整的候选集、用户的选择以及不断发展的叙述上下文,从而产生具有持久用户级标识符的按时间排序的轨迹。 Rushes 包含来自 6 个游戏中 8,167 个唯一用户的 44,226 个决策事件,捕获连续的、个性化的参与行为,而不是静态判断。我们表明,用户选择表现出结构化的非随机模式,通过相对于统一基线的低选择熵进行量化。我们将 Rushes 定位为多元对齐的诊断基准,并展示了强大的参与差距:最先进的 LLM(包括 GPT-5)未能超越简单的基线。虽然经典矩阵分解 (SVD) 捕获了可测量的个性化信号 (37.7%),但前沿 LLM (34.23%) 甚至很难在事件级选择预测上匹配流行度基线 (36.4%)。这一差距表明,单一的、人口层面的目标,比如现代 RLHF 中使用的目标,似乎不足以捕获异构的、依赖于环境的参与信号。因此,即使是能力很强的模型也会默认大多数人的偏好,而不是适应个人的轨迹。我们发布 Rushes 来支持生成系统中多元对齐和顺序决策的研究。平台和数据集的完整代码将在此处提供:https://github.com/microsoft/rushes