论文
BeliefShift:对 LLM 代理中的时间信念一致性和意见漂移进行基准测试
BeliefShift: Benchmarking Temporal Belief Consistency and Opinion Drift in LLM Agents
摘要
LLM 越来越多地用作长时间运行的会话代理,但评估其记忆力的每个主要基准都将用户信息视为要存储和检索的静态事实。那是错误的模型。人们的想法会改变,而且在长时间的互动中,观点漂移、过度一致和确认偏差等现象开始变得非常重要。 BeliefShift 引入了专门设计用于评估多会话 LLM 交互中的信念动态的纵向基准。它涵盖三个轨道:时间信念一致性、矛盾检测和证据驱动的修订。该数据集包括 2,400 个人工注释的多会话交互轨迹,涵盖健康、政治、个人价值观和产品偏好。我们在零样本和检索增强生成 (RAG) 设置下评估了七个模型,包括 GPT-4o、Claude 3.5 Sonnet、Gemini 1.5 Pro、LLaMA-3 和 Mistral-Large。结果揭示了一个明显的权衡:积极个性化的模型很难抵抗漂移,而基于事实的模型则错过了合理的信念更新。我们进一步引入了四种新颖的评估指标:信念修正准确性(BRA)、漂移一致性得分(DCS)、矛盾解决率(CRR)和证据敏感性指数(ESI)。