论文

用于相机胶卷 VQA 的个人 AI 代理

Personal AI Agent for Camera Roll VQA

上下文与知识记忆Agent记忆

摘要

我们研究个人相机胶卷视觉问答设置。在这种设置中,对话式人工智能助手可以访问用户的个人相机胶卷并检索相关照片来回答查询,范围从简单的事实问题(例如“我昨天尝试的食物的名称?”)到更开放式的问题(例如“推荐一些我以前从未吃过的菜肴”)。鉴于个人相机胶卷的巨大性质(即多年、数百到数千张照片),成功的人工智能助手需要了解长期、高度个性化的视觉内容流,以便导航和定位正确和/或相关信息。为了支持这一点,我们收集并手动注释模仿现实世界使用情况的问题。最终数据集 camroll 包含 50 个用户、31,476 张图像和 2,500 个 QA 对。我们进一步设计了 camroll-agent,这是一个会话式 AI 代理,配备了分层内存和一套最小的工具,可在大量个性化视觉内存上进行有效导航。实验结果表明,camroll-agent 优于长上下文理解 AI 代理系统的众多基线和方法。 camroll 数据集和 camroll-agent 共同凸显了人工智能代理长上下文推理中的差距:个性化视觉记忆需要与标准长上下文文本记忆不同的方法,特别是当存在一致性、视觉细节和用户特定上下文时。