论文

DMV-Bench:通过附带提示注入诊断长视野多模式代理的视觉记忆

DMV-Bench: Diagnosing Long-Horizon Multimodal Agents' Visual Memory with Incidental Cue Injection

智能体系统Agent任务评测

摘要

用于测量记忆的代理基准主要研究文本案例,其中信息是故意从环境中提取、写下来,然后检索的。换句话说,他们评估智能体选择记录的内容,而不是他们碰巧看到的内容。我们引入了 DMV-Bench(代码:https://github.com/yyyujintang/DMV-Bench),这是多模式智能体中第一个视觉记忆的交互式基准,来研究这个经常被忽视的属性。 DMV-Bench 构建于 (1) 受控的家居电子商务环境,由 1,000 个产品变体的目录支持,以及 (2) 文本泄漏合约,确保每个任务的主要判别信号仅存在于像素中。在 DMV-Bench 中,客服人员会经历一系列自主购物会话,其中每个访问过的产品图像都带有一个独特的、预先渲染的附带提示,客服人员随后会被要求回忆起来。我们表明传统的解决方案很难完成这项任务。受双编码理论的启发,我们提出了一种使用并行视觉和语言编码的内存架构,我们称之为 DualMem。在 DMV-Bench 上,DualMem 在多个模型上的多会话链长度上优于仅图像描述基线和三个最新的多模式代理记忆系统。即使根据内存库大小和编码位置偏差进行调整,这些收益仍然持续存在。进一步的实验还揭示了两种代码之间的不对称分工。加权编码方案通常是最强的。我们认为这是朝着记忆系统迈出的一步,该系统可以保存更丰富的代理观察记录。