论文
工具调用Agent采用监督微调还是强化学习:比较数据、方法与模型规模
SFT or RL for Tool-Calling Agents? A Controlled Study Across Data, Method, and Scale
摘要
关于训练数据、适应方法和模型规模如何共同影响语言模型代理的工具调用性能,存在有限的受控证据。我们评估了 LoRA 的监督微调 (SFT)、通过组相对策略优化 (GRPO) 的强化学习 (RL) 以及 SFT 和 GRPO 后的 6 个 Qwen3 模型(从 0.6B 到 32B 参数),涵盖分布内性能和跨数据集传输。采用 LoRA 的 SFT 是整个 0.6B-32B 范围内最强的分布方法,并且在 18 个实验设置中的 15 个中表现最好。在跨数据集传输方面,这些方法更接近:GRPO 在训练和测试数据集不同的 54 个设置中胜出 29 个,但其与 SFT 平均差距不到 1 个百分点,并且 SFT->GRPO 在任一比较中都很少最强。无论采用何种方法,数据集混合都能提供始终如一的强大传输,同时保持接近专门的分布训练。额外的分析进一步证实 LoRA 优于全参数微调,证明 LoRA 更好地保留了预训练的代理行为。