论文

BenchPreS:持久记忆LLM的上下文感知个性化偏好选择性基准

BenchPreS: A Benchmark for Context-Aware Personalized Preference Selectivity of Persistent-Memory LLMs

模型评测上下文与知识记忆基准与评测资源Agent记忆

摘要

大语言模型(LLM)日益将用户偏好存入持久记忆,以支持跨交互的个性化。然而,在受社会与机构规范约束的第三方沟通情境中,某些用户偏好并不适合施加。我们提出BenchPreS,评估基于记忆的用户偏好在各沟通情境中是被恰当施加还是应被抑制。借助误用率(MR)与恰当施加率(AAR)两个互补指标,我们发现即使前沿LLM也难以以情境敏感的方式施加偏好。偏好遵从更强的模型表现出更高的过度施加率,且推理能力与基于提示的防御都无法完全解决该问题。这些结果表明,当前LLM将个性化偏好当作全局可执行的规则,而非依赖情境的规范性信号。

BenchPreS:持久记忆LLM的上下文感知个性化偏好选择性基准:论文配图
图 2:BenchPreS 设置概览。给定任务提示和包含用户偏好的持久记忆,模型必须生成应用上下文适当偏好的响应,同时抑制不适当的偏好。上面的示例成功了,而下面的示例失败了。