论文
多模式代理的以任务为中心的记忆
Task-Focused Memorization for Multimodal Agents
摘要
长期记忆对于多模式智能体建立连贯的经验、积累世界知识和实现持续学习至关重要。然而,构建有效的内存超出了内存模块设计和准确性和保真度等基本要求;关键的挑战在于确定要记住什么。多模态代理(例如实体代理)在真实或虚拟环境中持续感知、推理和行动,接收无限的多模态观察流。从这种信息组合爆炸中,智能体必须有选择地保留与其在环境中的角色相关且对未来任务有价值的内容。为了弥补这一差距,我们将记忆生成构建为一种可学习的记忆策略,并引入 TaskMem(以任务为中心的记忆策略学习),这是一种基于强化学习的框架,使策略能够根据环境中遇到的实际任务的需求动态调整其焦点。 TaskMem 采用两阶段训练范式:第一阶段通过在基本保真度要求下优化记忆质量来学习如何记忆;第二阶段发生在部署之后,代理通过在其基础 MLLM 上调整适配器来学习要记忆的内容,使用最近的环境任务来定义奖励模型,以指导任务相关内容的记忆策略。为了评估我们的方法,我们将 VideoMME、EgoLife 和 EgoTempo 重新制定为流基准,模拟真实的环境,其中代理处理流观察并处理在线到达的任务。为了隔离记忆评估,必须仅使用代理的记忆来回答问题,而不能访问原始视频。 TaskMem 基于 Qwen3-VL-30B-A3B 构建,在这些基准测试中,VQA 准确度分别提高了 6.3%、7.0% 和 5.3%。