论文

CUE-Mem:评测Agent对隐式多模态用户线索的长期记忆

CUE-Mem: Benchmarking Long-Term User Memory via Implicit Cues in Multimodal Conversations

智能体系统上下文与知识记忆Agent任务评测Agent记忆

摘要

长期记忆对于通过持续对话与用户交互的多模式Agent至关重要。然而,用户记忆并不总是被明确表述:它们也可能通过图像中重复出现的背景对象、音频中的环境声音或其他外围多模态线索来暗示。现有的基准主要侧重于纯文本记忆或显式多模态证据,而隐式多模态线索尚未得到充分探索。我们引入了 CUE-Mem,这是一种文本-图像-音频基准,用于根据隐式提示评估长期用户记忆。 CUE-Mem 包含 2,674 个跨显性和隐性证据设置的问题,涵盖四项任务:实体回忆、长模式、个性化推荐和拒绝回答。在文本化记忆系统中,隐式性能仍然远远低于神谕证据,其主要瓶颈在于保存和检索微妙线索,而不是问题的可回答性。增加字幕细节可以恢复更多的证据,但会带来不均匀的收益和快速增长的词元成本,从而激励本地多模式访问。然而,本机访问并不能统一解决瓶颈:证据的使用强烈依赖于主干网,而多模式索引会引入大量的检索噪声。 CUE-Mem 为记忆系统提供了一个测试平台,可以选择性地保留、检索和使用微妙的多模态证据。