论文

通过 同策略 内在知识边界增强实现高效代理强化学习

Efficient Agentic Reinforcement Learning with On-Policy Intrinsic Knowledge Boundary Enhancement

智能体系统Agent 工具调用

摘要

事实证明,代理强化学习 (RL) 对于训练具有外部工具使用功能的基于 LLM 的代理来说是有效的。然而,我们发现代理强化学习训练会导致冗余工具调用的增加,并模糊模型的内在知识边界,模型无法区分何时需要工具以及何时参数知识就足够了。基于奖励塑造的现有解决方案创建了粗粒度的优化目标,这些目标往往会激励不加区别的工具调用抑制,从而导致 奖励作弊。在本文中,我们提出了 AKBE(代理知识边界增强),这是一种 同策略 方法,可在训练期间通过双路径(有工具和无工具)轨迹采样动态探测模型的内在知识边界。我们将知识边界定义为每个实例确定是否需要工具以及所需的最少工具调用。通过比较不同路径的正确性,AKBE 对轨迹进行分类并构建有针对性的监督信号,指导每个问题的有效工具使用模式。这些信号无缝集成到代理强化学习训练循环中。对七个 QA 基准的实验表明,与标准代理 RL 相比,AKBE 平均将任务准确性提高了 +1.85,并将工具调用减少了 18%,从而使工具生产力提高了 25%,而无需权衡任何准确性与效率。进一步的分析表明它在不同的 RL 算法和每个信号类别的机制之间具有即插即用的兼容性。我们的代码可在 https://github.com/CuSO4-Chen/AKBE 获取。