论文
ReToolSQL:以智能体强化学习实现稳健的文本到SQL转换
ReToolSQL: Agentic Reinforcement Learning for Robust Text-to-SQL
摘要
最近的工作表明,从执行反馈中进行强化学习可以显着提高文本到 SQL 的性能,通常使较小的模型能够匹配或超过更大的系统。然而,大多数现有方法将 SQL 生成视为单轮任务,限制了模型通过迭代细化从错误中恢复的能力。我们提出了 ReToolSQL,一个用于文本到 SQL 的两阶段训练框架,它结合了(i)拒绝采样推理轨迹上的监督热启动和(ii)多轮工具使用轨迹上的代理强化微调(RFT)。关键的见解是,这两个阶段作用于互补的轴上,对经过验证的特权教师跟踪的监督微调 (SFT) 扩展了可解决的问题集(提高了最困难情况下的 pass@k 覆盖率),而 RFT 通过教导模型何时验证、检索哪些证据以及如何从执行反馈修复错误 SQL,将扩展的功能转换为更高的单遍精度。应用于 Gemma 4 指令调整 (31B) 时,仅 RFT 在 BIRD-SQL 开发基准上就实现了 73.66% 的执行准确度 (EX)(自一致性为 74.12% EX)。从 SFT 检查点 (SFT$\to$RFT) 初始化 RFT 会产生我们最强的模型,单程 EX 率为 74.32%,自我一致性为 74.77% EX。截至撰写本文时,这在 BIRD 单模型开发集排行榜上排名第一。该方法使用基于执行正确性的复合奖励,不需要超出基准本身的人工注释,并且在单个密集的 31B 模型中运行,这表明在工具使用轨迹上正确设计的 SFT$\to$RFT 管道是实现强大的企业级文本到 SQL 的实用路径。
