论文
当个人记忆没有唯一答案:评估不可消解冲突下的LLM Agent
When Personal Memory Has No Single Answer: Evaluating LLM Agents under Irreducible Conflict
摘要
LLM Agent越来越多地跨会话维护个人记忆,但记忆之间可能发生冲突。偏好依赖上下文,行为会演变,不同来源可能相互矛盾。当查询缺乏解释冲突所需的上下文、时间或来源权威时,把某条记忆当作定论,会将未解决的冲突转化为无依据的过度自信行动。现有基准从冲突证据中还原出单一答案,忽视了Agent是否能识别欠定性、保留备选项、寻求缺失信息并选择恰当行动。我们提出TANGLE(Testing Agents' Navigation of Genuine, Latent, and Entangled Memory Conflicts),一个针对真正不可解记忆冲突的基准。它包含40个人设(persona)下的541个实例,涵盖三种类型:上下文划分冲突(CPC)、行为振荡冲突(BOC)和来源矛盾冲突(SCC)。我们在五个维度上评估两条赛道——使用精选记忆的oracle赛道和从多会话对话中抽取记忆的pipeline赛道:冲突感知、因果推理、置信度校准、澄清寻求和记忆忠实度。实验揭示了pipeline的挑战。在精选记忆下,模型识别冲突比校准行动或寻求针对性澄清更可靠。在端到端pipeline记忆下,抽取过程未能保留下游推理所需的冲突承载关系。策略比较表明,当行动必须反映冲突时,固定规则并不足够。这些发现催生了冲突感知行动策略(CAAP),它利用现有证据针对每种冲突调整行动。TANGLE将冲突处理框定为:识别欠定性、保留冲突证据,并在不强行给出定论的情况下采取行动。
