论文
AEM:面向多回合Agentic强化学习的自适应熵调制
AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning
摘要
强化学习 (RL) 显着提高了大语言模型 (LLM) 代理与环境交互和解决多轮任务的能力。然而,有效的训练仍然具有挑战性,因为稀疏的、仅注重结果的奖励使得很难将功劳分配给智能体行动轨迹中的各个步骤。常见的补救措施是引入密集的中间监督,例如过程奖励模型或辅助自监督信号,但这会增加监督和调整的复杂性,并且通常很难跨任务和领域泛化。本文提出了 AEM,一种无监督的贡献归因方法,可在 RL 训练期间自适应地调节熵动态,以实现更有效的探索-利用权衡。理论上,我们将熵分析从token级别提升到响应级别,以减少token采样方差,并表明自然梯度下的熵漂移本质上是由优势和相对响应惊喜的乘积决定的。具体来说,我们得出了一个实用的代理来重塑训练动态,从而实现从探索到利用的自然过渡。跨各种基准和模型(从 1.5B 到 32B 参数)的大量实验证明了 AEM 的有效性,包括在高度具有挑战性的 SWE-bench-Verified 基准上集成到最先进的基准中时,获得了 1.4% 的显着增益。