论文

Agentic RL 中推理与工具使用相互竞争:从量化干扰到解耦调优

Reasoning and Tool-use Compete in Agentic RL:From Quantifying Interference to Disentangled Tuning

模型训练强化学习Agentic RL

摘要

代理强化学习 (ARL) 专注于训练大语言模型 (LLM),将推理与外部工具执行交织起来,以解决复杂的任务。大多数现有的 ARL 方法训练单个共享模型参数来支持推理和工具使用行为,隐含地假设联合训练可以提高代理的整体性能。尽管这一假设被广泛采用,但很少经过实证检验。在本文中,我们通过引入线性效应归因系统(LEAS)系统地研究了这一假设,该系统提供了推理和工具使用行为之间干扰的定量证据。通过深入分析,我们表明这两种功能经常会导致梯度方向错位,从而导致训练干扰,从而破坏联合优化的有效性并挑战现行的 ARL 范式。为了解决这个问题,我们提出了解缠结动作推理调整(DART),这是一个简单而高效的框架,它通过单独的低阶适应模块显式地解耦推理和工具使用的参数更新。实验结果表明,DART 始终优于基准方法,平均提高了 6.35%,并且实现了与使用单个模型明确分离工具使用和推理的多代理系统相当的性能。

Agentic RL 中推理与工具使用相互竞争:从量化干扰到解耦调优
图1:线性效应归因系统(Linear Effect Attribution System,LEAS)概览。(A) 推理派生模型(Inference-derived Model):通过在推理时将特定 token 类型路由到不同模型,我们在无参数级交互的情况下合成能力组合。(B) 线性效应归因系统:六个模型变体(训练派生与推理派生)填充设计矩阵 𝐗。求解线性系统得到问题特定的系数 𝝀^q,其中 λ_23<0 表示能力干扰。(C) Token 级梯度掩码(Token-Level Gradient Masking):训练期间,token 级掩码选择性地将梯度路由到推理或工具使用参数,隔离能力特定的更新。(D) 训练派生模型(Training-derived Models):由此产生从共享主干派生的专门化模型变体,实现不同能力组合间的受控比较。