论文

冲突多源个人记忆上的选择性问答:诊断测试床与方法比较

Selective QA over Conflicting Multi-Source Personal Memory: A Diagnostic Testbed and Method Comparison

模型评测上下文与知识记忆基准与评测资源Agent记忆

摘要

新兴的个人AI智能体正走向持久化、多来源的记忆。这带来了一个评估难题:系统必须决定如何使用相互冲突或不完整的证据,而不能只从单一干净的历史记录中检索事实。现有基准很少能区分一个错误究竟来自提供给方法的证据,还是来自方法自身的冲突消解环节。我们将这一问题研究为冲突多源个人记忆上的选择性问答:系统基于相互冲突、有时不完整的来源作答,或在证据不足时选择弃答。我们构建了一个基准,包含8类推理的18个问题模板、480个人设、4个随机种子和34,560个实例,具有受控的来源扭曲与确定性的标准答案。我们评估了不访问任何来源的基线、仅访问单一来源的基线、结构化融合方法以及前沿LLM的表现。最好的经训练融合求解器达到80.3%的准确率,而最强的纯提示LLM基线达到70.0%。引入弃答后,同一求解器在78.3%覆盖率下达到85.3%的选择性准确率,最佳LLM在95.4%覆盖率下达到71.0%的选择性准确率。不同模型在不同推理类型上各有所长。我们发布数据、代码、缓存的模型输出与数据生成过程以供复用。

冲突多源个人记忆上的选择性问答:诊断测试床与方法比较:论文配图
图1:个人记忆智能体面对五个相互冲突的记忆源:直接提示易轻信乐观或模糊来源,校准裁决器可给出更保守分档答案或弃答。