论文
M$^3$Exam:真实用户代理交互的多模态内存基准测试
M$^3$Exam: Benchmarking Multimodal Memory for Realistic User-Agent Interactions
摘要
语言代理越来越多地部署在积累多模态信息上,但现有的基准假设具有稀疏视觉和简单内容的人与人形式,既不评估对真实多模态文件交互的推理,也不评估对隐藏用户信息的解释。因此,我们引入了 M$^3$Exam,这是一个以查询为中心的多模态会话记忆基准,建立在现实的用户代理交互之上,具有跨模态基础和隐式信息推理的多维评估。对 MLLM 和记忆系统进行基准测试揭示了跨模态基础、跨会话推理以及积累多模态上下文的效率成本方面持续存在的差距。我们进一步提出了 M$^3$Proctor,一种多模态内存方法,可检测查询模态偏差并仅按需消耗原始视觉源,将准确性提高 13%,同时将索引构建时间和检索标记减少 70% 以上。