论文
Agent-Omit:通过代理强化学习训练高效的 LLM 代理以实现自适应思维和观察遗漏
Agent-Omit: Training Efficient LLM Agents for Adaptive Thought and Observation Omission via Agentic Reinforcement Learning
摘要
在多轮智能体-环境交互中管理智能体上下文(如思考与观察)是提升智能体效率的新兴策略。然而,现有研究平等对待整条交互轨迹,忽视思考的必要性与观察的效用在各轮之间存在差异。为此,我们首先就思考与观察如何影响智能体的效果与效率开展定量研究。基于这些发现,我们提出Agent-Omit,一个使LLM智能体能够自适应省略冗余思考与观察的统一训练框架。具体而言,我们首先合成少量冷启动数据(涵盖单轮与多轮省略场景)来微调智能体的省略行为。此外,我们引入省略感知的智能体强化学习方法,纳入双采样机制与定制的省略奖励,以激励智能体的自适应省略能力。在理论上,我们证明省略策略的偏差以KL散度为上界。在五个智能体基准上的实验结果表明,我们构建的Agent-Omit-8B可获得与七个前沿LLM智能体相当的性能,并在七个高效LLM智能体方法中取得最佳的效果-效率权衡。我们的代码与数据见 https://github.com/usail-hkust/Agent-Omit。
