论文
Agentic RL 中推理与工具使用相互竞争:从量化干扰到解耦调优
Reasoning and Tool-use Compete in Agentic RL:From Quantifying Interference to Disentangled Tuning
摘要
代理强化学习 (ARL) 专注于训练大语言模型 (LLM),将推理与外部工具执行交织起来,以解决复杂的任务。大多数现有的 ARL 方法训练单个共享模型参数来支持推理和工具使用行为,隐含地假设联合训练可以提高代理的整体性能。尽管这一假设被广泛采用,但很少经过实证检验。在本文中,我们通过引入线性效应归因系统(LEAS)系统地研究了这一假设,该系统提供了推理和工具使用行为之间干扰的定量证据。通过深入分析,我们表明这两种功能经常会导致梯度方向错位,从而导致训练干扰,从而破坏联合优化的有效性并挑战现行的 ARL 范式。为了解决这个问题,我们提出了解缠结动作推理调整(DART),这是一个简单而高效的框架,它通过单独的低阶适应模块显式地解耦推理和工具使用的参数更新。实验结果表明,DART 始终优于基准方法,平均提高了 6.35%,并且实现了与使用单个模型明确分离工具使用和推理的多代理系统相当的性能。
