论文
为什么多步骤工具使用强化学习会失败以及监督信号如何修复它
Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It
摘要
工具的使用使 大语言模型 (LLM) 能够执行复杂的任务,而最近的代理强化学习 (RL) 方法显示出增强模型能力的希望。然而,单独的强化学习通常会导致工具使用任务的不稳定或收益有限。在我们的实验中,一些模型表现出灾难性的崩溃,其中性能突然下降并且工具调用结构失败。分析表明,这些失败源于特定控制词元中意外的概率峰值,扰乱了结构化执行,但底层工具使用功能仍然完好无损,只是被特定格式掩盖了。为了解决这个问题,我们系统地研究了在同步和交错训练方案下应用的一组不同的监督信号,包括 离策略 监督、基于提示的指导、错误示例监督等。我们发现,将监督 微调 (SFT) 与 RL 进行交错可显着提高稳定性,但在格式和内容分发外 (OOD) 评估下表现出性能下降。我们还分析了学习率和跨环境泛化的影响。这些结果凸显了理解 RL 失败的重要性,并展示了不同的监督信号如何指导探索性学习,从而为复杂的多步骤工具使用任务实现 LLM 的稳健训练。我们的代码可在 https://github.com/hypasd-art/Tool-RL-Box 获取。