论文

SMMBench:源分布式多模式代理记忆基准

SMMBench: A Benchmark for Source-Distributed Multimodal Agent Memory

模型评测上下文与知识记忆基准与评测资源Agent记忆

摘要

多模态记忆推理的现有基准主要评估预组装上下文中的系统,但低估了智能体是否可以使用分布在独立来源的证据。我们认为,源分布式记忆构成是多模式代理记忆中一个重要且未被充分研究的瓶颈,特别是当相关证据分散在异构工件(例如对话、配置文件、屏幕截图、表格、图像和文档)中时。为了解决这一差距,我们引入了源分布式多模态记忆基准(SMMBench),它衡量代理是否可以检索、对齐和组合分散在多个源中的多模态证据,而不是在单个策划的上下文中进行推理。 SMMBench评估四个核心能力:(1)跨源多模态推理; (2) 冲突解决; (3) 偏好推理; (4)基于记忆的动作预测。该基准包含来自 264 个来源的 1877 个样本。对代表性记忆风格和基于检索的基线进行的实验表明,当前的系统在这些能力上仍然存在困难,将源分布式多模态记忆定位为多模态智能体的一个重要且仍被低估的挑战。我们的数据可在 https://huggingface.co/datasets/HuacanChai/SMMBench 上获取。