论文

多任务代理强化学习的熵调步策略优化

Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning

模型训练强化学习

摘要

强化学习 (RL) 最近的突破凸显了其在复杂代理 大语言模型 (LLM) 任务中的潜力。然而,现有的工作主要集中在单任务设置上,而现实世界的部署需要一个能够同时解决多个任务的通用代理。在这项工作中,我们发现了多任务代理强化学习中一个关键但尚未充分探索的现象:不同的任务可能会表现出探索-利用速度不匹配。具体来说,较容易的任务可能会提前收敛到低熵策略,从而阻碍对较困难任务的学习,而较困难的任务反过来又会将较容易的任务推回高熵探索。这种来回交互会产生任务间的熵交叉和频繁的熵峰值。受这一观察的启发,我们引入了用于多任务代理 LLM 的熵调步策略优化(EPPO),它协调任务之间的熵以稳定多任务优化。 EPPO 的核心是任务级动态裁剪机制,它用任务熵感知自适应界限取代了组相对策略优化 (GRPO) 中的固定裁剪阈值,收紧了过度自信任务的更新,同时放宽了探索不足的任务的更新。多任务代理基准的实验表明,所提出的 EPPO 产生的结果优于其同行。