论文

MemGym:面向长程任务的智能体记忆评测环境

MemGym: a Long-Horizon Memory Environment for LLM Agents

模型评测基准与评测资源

摘要

记忆是大语言模型智能体执行长程任务的核心能力。现有基准主要测试多轮聊天中个性化信息的保留,忽略长时间执行中的动态记忆形成,因此得到的记忆系统难以迁移到编码与网页操作等环境。MemGym 用统一的记忆推理接口接入现有智能体环境和内部基于记忆的流程,设置五条评测轨道,覆盖工具对话(tau2-bench)、多轮深度研究搜索(MEMGYM-DR)、编码(SWE-Gym、MEMGYM-CODEQA)和计算机操作(WebArena-Infinity)四类场景。其记忆独立评分将记忆表现与推理、检索、工具使用能力区分,减少这些因素对记忆策略排名的干扰。MEMGYM-CODEQA 与 MEMGYM-DR 的合成流程长度可控,各阶段经过消融验证,并与下游场景对齐。为降低编码环境评测成本,研究用 QLoRA 微调 Qwen3-1.7B 得到 MemRM,以快速标量评分衡量压缩质量,替代完整 Docker 交互轨迹执行。