论文
According to Me:长期个性化指涉记忆问答
According to Me: Long-Term Personalized Referential Memory QA
摘要
个性化 AI 助手必须回忆并推理长期用户记忆,这种记忆自然跨越图像、视频和电子邮件等多种模态与来源。然而,现有长期记忆基准主要聚焦对话历史,未能捕捉扎根于真实生活经验的个性化指涉。我们提出 ATM-Bench,首个面向多模态、多来源个性化指涉记忆问答的基准。ATM-Bench 包含约四年的隐私保护个人记忆数据和带真值记忆证据的人工标注问答对,其中包括需要解析个人指涉、跨多源多证据推理以及处理冲突证据的查询。我们提出模式引导记忆(SGM),以结构化表示来自不同来源的记忆项。实验中,我们实现 5 个最先进的记忆系统和标准 RAG 基线,并评估采用不同记忆摄取、检索与答案生成技术的变体。我们发现在 ATM-Bench-Hard 集上表现很差(准确率低于 20%),且 SGM 优于既有工作常用的描述式记忆。代码见:https://github.com/JingbiaoMei/ATM-Bench。
