论文

学习何时不行动:缓解智能体强化学习中的工具滥用

Learning When Not to Act: Mitigating Tool Abuse in Agentic Reinforcement Learning

模型训练强化学习RLVRAgentic RL

摘要

代理强化学习可能会导致工具滥用,其中模型过度使用外部工具,甚至对于可通过内部推理解决的查询也是如此。现有方法通过统一的工具使用惩罚或硬性限制来缓解这个问题,这会降低工具频率,但也可能抑制有用的工具辅助探索。我们提出了 EAPO,一种高效的代理策略优化框架,可以学习选择性工具的使用。 EAPO 将无工具轨迹引入每个部署组,应用难度感知奖励塑造来惩罚主要在更简单的查询上的冗余工具调用,并使用置信感知令牌重新加权来改进策略学习。在九个数学和知识密集型推理基准测试中,EAPO 持续改进了 Qwen2.5-3B、Qwen2.5-7B 和 Llama3.1-8B 上的准确性效率权衡。与GRPO相比,EAPO平均性能提高了10.45%、7.27%和9.69%,同时平均工具调用次数分别减少了18.33%、18.33%和24.59%。这些结果表明,智能体可以学习何时不使用工具,而不会影响工具集成推理。

学习何时不行动:缓解智能体强化学习中的工具滥用:论文配图
图 1:工具滥用的说明性示例:在代理 RL 训练之后,Qwen-3B 模型变得过度依赖工具,甚至会为了一些琐碎的问题而调用它们。