论文

DSV-Mem:专业工作流中的多模态状态记忆

DSV-Mem: Evaluating Multimodal Memory in Professional Workflows for MLLM Agents

智能体系统上下文与知识记忆Agent任务评测Agent记忆长程任务评测

摘要

人们越来越期望会话式 MLLM 智能体能够协助专业工作流程,从人工智能研究和工程设计到产品管理和业务运营。然而,这种能力仍未得到充分探索:现有基准主要关注非正式的日常互动和个人生活场景,以摄影自然图像、孤立的静态工件和面向 召回率 的问题为特征。相比之下,专业场景通常涉及经过频繁修订和权限更新的结构化、信息量大的工件,以及需要协调许多工件版本同时精确跟踪状态的组合查询。为了应对这些挑战,我们引入了 DSV-Mem,这是评估密集状态视觉记忆的基准。 DSV-Mem 包含专家审查的场景和 1,000 个问题,涉及五个面向用户的类别(当前状态、过去状态、派生状态、更改历史记录和冲突/拒绝)。受哈特利启发的标准有利于具有更广泛的视觉证据检查要求的问题。我们还引入了一代 Harness,它通过将状态转换合成与对话填充解耦来生成评估套件。对涵盖前沿、开放权重 模型和记忆管理方法的 27 种配置进行的评估表明,DSV-Mem 上最强的基线得分低于 45%。分析结果表明:1)多模态和信息密度都会增加难度,但状态演化,特别是治理更新的数量,是主要的测试因素。原始对话/干草堆长度、OCR 和算术不是主要瓶颈; 2)模型在回答之前通常无法根据先前的状态更新来验证用户场所; 3) 增加推理工作和记忆管理方法产生的收益有限,而状态感知设计则证明更有效。基准测试和代码将公开发布。

DSV-Mem:专业工作流中的多模态状态记忆:论文原图
图 1:现有基准测试与 DSV-Mem 之间的比较。现有的基准(左)在使用稀疏静态照片的休闲对话中提出质量保证,可能高估了现实世界的可靠性(A-E)。 DSV-Mem 通过针对密集、不断发展的专业工件(右)的目标导向工作流程来解决这些限制,并且 QA 需要跨版本的权威状态跟踪(A-E)。匹配的字母将每个点链接到两个面板上的图示示例。