论文
记住、验证还是询问? LLM 代理中记忆承诺的跨家庭评估
Remember, Verify, or Ask? Cross-Family Evaluation of Memory Commitment in LLM Agents
摘要
持久内存可以个性化 LLM 代理,但不正确的持久更新可能会默默地扭曲未来的行为。我们研究记忆澄清边界:是否应该保留交互衍生的信息、仅在当前上下文中使用、重新验证或向用户澄清。 MCB 包含 140 个主要场景,分为 70 个开发项目和 70 个保留项目,以及一个单独的 70 个项目对比集。它评估操作标签和结构化工具调用选择。两名非作者独立标记 70 个保留的主要项目和 70 个对比项目(97.1% 一致,Cohen's kappa = 0.962);盲目的三分之一解决了四个分歧,用非作者多数取代了八个作者标签。在 Claude 和 Qwen 中,模型验证不断变化的事实比要求用户解决歧义更可靠。 Bare Qwen 询问 0/12 澄清项目,同时验证 12/18 新鲜度项目。少量提示将准确度从 0.557 提高到 0.771(配对 delta = +0.214,Holm 调整后的精确 McNemar p_H = 0.002),但澄清召回率仍为 0.333。策略提示将错误持久性从 0.243 减少到 0.100 (p_H = 0.038),尽管其准确性增益并不显着。每个 Claude 模型的标签工具一致性为 57%,Qwen 的标签工具一致性为 23%; Qwen 准确度从 0.557 下降到 0.343 (p_H = 0.047)。内存评估必须测试既定决策和工具调用选择。