论文
BenchPreS:持久记忆LLM的上下文感知个性化偏好选择性基准
BenchPreS: A Benchmark for Context-Aware Personalized Preference Selectivity of Persistent-Memory LLMs
摘要
大语言模型(LLM)日益将用户偏好存入持久记忆,以支持跨交互的个性化。然而,在受社会与机构规范约束的第三方沟通情境中,某些用户偏好并不适合施加。我们提出BenchPreS,评估基于记忆的用户偏好在各沟通情境中是被恰当施加还是应被抑制。借助误用率(MR)与恰当施加率(AAR)两个互补指标,我们发现即使前沿LLM也难以以情境敏感的方式施加偏好。偏好遵从更强的模型表现出更高的过度施加率,且推理能力与基于提示的防御都无法完全解决该问题。这些结果表明,当前LLM将个性化偏好当作全局可执行的规则,而非依赖情境的规范性信号。
