论文
来自显性和隐性证据的个人视觉记忆
Personal Visual Memory from Explicit and Implicit Evidence
摘要
长期记忆对于个性化人工智能代理来说越来越重要,但现有的基准和方法仍然主要以文本为中心。即使包含图像,后续问题所需的用户特定信息通常也可以仅从文本中恢复,并且大多数存储系统将图像转换为通用描述文本。然而,图像通常携带文本很少提及的个人信息——既有明确的证据,例如重复出现的用户相关实体,也有隐性的证据,例如从视觉或多模式线索推断出的潜在用户事实。我们引入了针对两种形式的证据的个人视觉记忆基准,并提出了 VisualMem,一种混合视觉-文本架构,它通过结构化个人视觉记忆模块增强了文本记忆后端。 VisualMem 不是将图像折叠成描述文本,而是使用对话上下文来解析身份、所有权和持久的用户事实。实验表明,VisualMem 在我们的基准测试中大大优于之前的记忆系统,同时在标准文本记忆基准测试中保持竞争力,这表明个人视觉记忆是个性化人工智能代理长期记忆的一个独特而重要的组成部分。