论文
具有熵指导的工具感知优化,可实现高效代理强化学习
Tool-Aware Optimization with Entropy Guidance for Efficient Agentic Reinforcement Learning
摘要
代理强化学习 (RL) 为 大语言模型 (LLM) 配备了工具使用功能,可显着提高复杂任务的推理能力。然而,集成外部工具往往会破坏训练的稳定性:过度依赖工具会导致输入分布变化,而过于保守的工具使用会限制有效的探索。为了解决这个问题,我们提出了一个统一的框架 TAO-RL,它将工具感知的轨迹过滤与熵引导的探索结合起来,以实现有效的策略优化。具体来说,在数据级别,TAO-RL 按照两个标准过滤执行轨迹轨迹:丢弃所有工具调用都无法执行的轨迹,并删除所有执行轨迹都正确或不正确的轨迹,因为这两种情况都会产生不提供区分性学习信号的退化优势估计。这种联合过滤保留了既具有工具功能又信息丰富的数据,从而建立了高质量的训练分布。在算法层面,我们引入了工具感知的熵引导奖励,它重塑了工具调用后词元的优势函数,鼓励策略在关键决策点探索更多样化的推理路径。这两个组成部分是相辅相成的:轨迹过滤建立了一个干净且信息丰富的训练基础,而熵引导的探索在关键的工具交互时刻推动了更强的推理行为。在 3 个模型尺度的 7 个具有挑战性的推理基准上进行的广泛实验证明了 TAO-RL 相对于现有方法的优越性。