论文

MemCalib:LLM 代理中的内存使用基准测试和优化

MemCalib: Benchmarking and Optimizing Memory Use in LLM Agents

模型训练强化学习

摘要

代理记忆的有效性最终取决于底层 LLM 是否给予上下文中的每个记忆对其响应的适当程度的影响。然而这种能力在很大程度上仍然被忽视。为了评估这种能力,我们引入了 MemCalib,这是一个基于实际内存系统场景的基准测试,用于评估内存使用情况和推进优化算法。 MemCalib 测试集的结果表明,前沿开源和闭源模型很难正确使用内存。他们经常过度使用或未充分使用记忆,而不是将每个命题的实际使用与其目标水平相匹配,从而导致有偏见的、低质量的响应。对常见的训练后算法(包括组相对策略优化和同策略自蒸馏)的实验进一步揭示了明显的方向性偏差:训练后的模型在一个方向上改进,而在另一个方向上恶化。因此,我们提出了 MemCalib-RL,这是一种有序的双向反事实信用分配算法,可以分离过度使用和未充分使用的信号,并通过精确的原子消融将其信用本地化到响应词元。跨模型系列和规模(Qwen3-8B、Ministral-3-8B-Instruct 和 Qwen3.5-35B-A3B)的结果表明,MemCalib-RL 实现了最佳整体性能,同时更好地平衡了过度使用和使用不足,在外部基准评估中,其收益普遍超越了 MemCalib。进一步的实验支持其设计选择和稳健性,并提供对其训练动态的深入了解。