论文
VIBE-Bench:当用户画像不等于偏好时,如何评估个性化大语言模型
VIBE-Bench: Evaluating Personalized Large Language Models When Profiles Don't Mean Preferences
摘要
个性化大语言模型 (PLLM) 旨在为个人用户定制响应,其中的核心挑战是偏好推理:从用户相关历史记录中推断与查询相关的偏好。然而,现有的基准在很大程度上假设可以从语义相关的历史中检索这种偏好。我们研究了一个尚未充分探索但实际上很重要的机制,即配置文件偏好概念错位(PRCM),其中可观察到的配置文件线索和特定于查询的偏好位于不同的概念空间中,使得语义检索与个性化不一致。我们引入了 VIBE-Bench,这是一个具有两个基于心理学的任务、3,504 个角色和 12,239 个对话的基准,其中包括手动验证的黄金测试集,并且需要超越表面语义重叠的跨概念偏好推理。几种个性化方法的实验表明,当前的 PLLM 在很大程度上依赖于浅层语义相关性,无法获得鲁棒的跨概念映射。这些发现将 PRCM 确定为 PLLM 中的一种独特故障机制,并将 VIBE-Bench 定位为超越语义匹配推进偏好推理的重点测试平台。