论文

Horizo​​nBench:具有不断变化的偏好的长期个性化

HorizonBench: Long-Horizon Personalization with Evolving Preferences

模型评测基准与评测资源

摘要

用户偏好会在几个月的交互过程中不断变化,跟踪它们需要推断出所陈述的偏好何时被随后的生活事件改变。我们将这个问题定义为长期个性化,并观察到该问题的进展受到数据可用性和测量的限制,没有现有资源提供自然的长期交互和诊断模型失败原因所需的 真值 出处。我们引入了一个数据生成器,它可以根据结构化心理状态图生成对话,为 6 个月时间范围内的每个偏好变化生成 真值 出处,并从中构建 Horizo​​nBench,这是来自 360 个模拟用户的 4,245 个项目的基准,具有 6 个月的对话历史,平均约 4,300 个回合和约 163K 词元。 Horizo​​nBench 为长上下文建模、记忆增强架构、心理理论推理和用户建模提供了一个测试平台。在 25 个前沿模型中,最佳模型达到 52.8%,大多数模型得分等于或低于 20% 机会基线。当这些模型在进化的偏好上出错时,超过三分之一的时间他们会选择用户最初声明的值而不跟踪更新的用户状态。这种信念更新失败在上下文长度和表达明确性级别上持续存在,将状态跟踪能力确定为长期个性化的主要瓶颈。