论文

PairPref:记忆何时应该引导答案?上下文偏好使用的基准

PairPref: When Should Memory Guide the Answer? A Benchmark for Contextual Preference Use

智能体系统上下文与知识上下文工程记忆Agent任务评测Agent记忆

摘要

记忆增强助理使用检索到的偏好来指导他们的反应。情况的微小变化可以改变偏好是否合适,而几乎不影响其检索相似性。内存基准测试通常测试系统是否存储和检索首选项,而很少关注何时应用这些首选项。我们引入 PairPref,一个上下文偏好使用的基准。每对仅改变情况,保持偏好、请求和四个候选者回复固定。在这两种情况下,该偏好仍然有效。在选择轨道中,模型必须选择仅在适当的情况下应用偏好的回复。在免费生成轨道中,他们必须在看不到候选人回复的情况下决定何时应用它。两个轨道都使用相同的 1,227 对,涵盖 45 个偏好和 8 个情况类别。我们评估了 8 个模型,其中大多数的选择分数 ($\Delta$) 为 51 到 65 分。然而,在自由生成中,两种响应仅在 3.6% 到 18.3% 的配对中适合各自的情况。即使检索到的记忆较少、呈现形式不同且提示更严格,模型也会继续在这两种情况下应用偏好。这些结果表明,模型仍然难以判断用户偏好何时适用并做出相应的响应。