论文
DSV-Mem:专业工作流中的多模态状态记忆
DSV-Mem: Evaluating Multimodal Memory in Professional Workflows for MLLM Agents
摘要
人们越来越期望会话式 MLLM 智能体能够协助专业工作流程,从人工智能研究和工程设计到产品管理和业务运营。然而,这种能力仍未得到充分探索:现有基准主要关注非正式的日常互动和个人生活场景,以摄影自然图像、孤立的静态工件和面向 召回率 的问题为特征。相比之下,专业场景通常涉及经过频繁修订和权限更新的结构化、信息量大的工件,以及需要协调许多工件版本同时精确跟踪状态的组合查询。为了应对这些挑战,我们引入了 DSV-Mem,这是评估密集状态视觉记忆的基准。 DSV-Mem 包含专家审查的场景和 1,000 个问题,涉及五个面向用户的类别(当前状态、过去状态、派生状态、更改历史记录和冲突/拒绝)。受哈特利启发的标准有利于具有更广泛的视觉证据检查要求的问题。我们还引入了一代 Harness,它通过将状态转换合成与对话填充解耦来生成评估套件。对涵盖前沿、开放权重 模型和记忆管理方法的 27 种配置进行的评估表明,DSV-Mem 上最强的基线得分低于 45%。分析结果表明:1)多模态和信息密度都会增加难度,但状态演化,特别是治理更新的数量,是主要的测试因素。原始对话/干草堆长度、OCR 和算术不是主要瓶颈; 2)模型在回答之前通常无法根据先前的状态更新来验证用户场所; 3) 增加推理工作和记忆管理方法产生的收益有限,而状态感知设计则证明更有效。基准测试和代码将公开发布。
