论文

经新颖性信号的联合智能体记忆与探索学习

Joint Agent Memory and Exploration Learning via Novelty Signals

模型训练强化学习Agentic RL

摘要

在开放环境中,探索对于自主智能体来说是基础,但当前的语言模型智能体却在努力解决这一问题。有效的探索需要记忆,但在长轨迹上保留原始交互历史在计算上是昂贵的。虽然潜在记忆提供了压缩交互历史的解决方案,但其训练缺乏可靠的监督信号。我们引入 \textbf{J}oint \textbf{A}gent \textbf{M}emory 和 \textbf{E}xploration \textbf{L}earning (\textbf{JAMEL}),这是一个通过新颖性驱动的交互来共同训练代理记忆和探索策略的框架。我们观察到记忆和探索形成了一个相互依赖的循环:持续的探索需要记忆来区分疲惫的行为和未见过的行为,而寻求新奇的互动提供了使记忆对未来的探索有用所需的监督。通过利用确定性和持久的新颖性信号(例如 GUI 域中的代码覆盖率),我们为内存模块提供自然的、无注释的监督。实证评估表明,我们的方法成功地推广到了看不见的环境。其探索能力优于开放权重基线,可与闭源模型的探索深度相媲美,同时减少词元消耗。我们的代码和模型在 https://github.com/MobileLLM/JAMEL 上开源。

经新颖性信号的联合智能体记忆与探索学习:论文配图
图 1:JAMEL 的架构。