论文

AMBER:训练长任务网页 Agent 的只追加记忆

AMBER: Training Long-Horizon Web Agents through Append-Only Memory

模型训练上下文与知识强化学习记忆Agentic RLAgent记忆

摘要

现代语言模型Agent越来越多地在外部环境执行长程多步任务,累积交互历史会迅速超出可用上下文预算。可靠执行需要长期保持事实、记住执行错误与纠正反馈,并追踪行动进展。已有方法包括保留推理和动作历史、学习覆写固定大小记忆以及定期摘要。原则上,覆写记忆能保留只追加记忆中的任意内容,但每次重写都必须继续携带每条事实,这难以从稀疏结果奖励学会。网页Agent实验中,训练得到的覆写记忆会删除后续所需信息及环境纠正反馈。我们提出AMBER(Append-only Memory Bank for Evidence Retention):Agent联合学习推理、行动和自由格式记忆写入,只追加规则从结构上保证内容保留。因此可直接使用结果奖励进行端到端强化训练,无需大量精心整理的SFT数据。在WebArena Lite上,相比覆写记忆平均成功率提高4.09个百分点,五次重复运行中至少解决任务的比例提高4.8个百分点,并匹配使用显著更昂贵人工整理监督训练的覆写基线。它在实用词元预算内兼顾上下文效率、任务表现与可靠长程执行。