论文

训练数据教 RL 记忆代理什么:记忆增强 QA 中课程效果的实证研究

What Training Data Teaches RL Memory Agents: An Empirical Study of Curriculum Effects in Memory-Augmented QA

模型训练合成数据

摘要

强化学习 (RL) 已成为训练 LLM 代理在多会话对话中对外部记忆库进行推理的可行方法。现有的工作仅在单一基准上进行训练,而训练数据的组成如何塑造记忆代理获得的技能则尚未确定。我们提出了一项受控实证研究,该研究保持架构、强化学习算法和所有超参数固定,仅在三种情况下改变训练课程:域内(LoCoMo)、混合基准(LoCoMo + LongMemEval)和域外(仅 LongMemEval)。在两个基准和十种问题类型中,课程构成充当专业化的细粒度杠杆,而不是绩效的统一比例因子。混合课程在两个评估集上产生最强的整体 F1。尽管总体表现较弱,但在狭窄的域外集上进行训练可以转移目标技能——时间推理。每种类型的差异大大超过总体差异,表明单一数字基准比较系统性地低估了课程效果。我们进一步报告了将 GRPO 适应单 GPU 机制的两个实际经验教训:跨基准混合需要从内存库中过滤格式特定的噪声以保留训练信号,而二进制精确匹配奖励在一个 GPU 所需的小组大小 (G = 4) 上不会产生学习信号,从而激发了该机制中的连续奖励函数。