论文

ReToolSQL:以智能体强化学习实现稳健的文本到SQL转换

ReToolSQL: Agentic Reinforcement Learning for Robust Text-to-SQL

模型训练强化学习Agentic RL

摘要

最近的工作表明,从执行反馈中进行强化学习可以显着提高文本到 SQL 的性能,通常使较小的模型能够匹配或超过更大的系统。然而,大多数现有方法将 SQL 生成视为单轮任务,限制了模型通过迭代细化从错误中恢复的能力。我们提出了 ReToolSQL,一个用于文本到 SQL 的两阶段训练框架,它结合了(i)拒绝采样推理轨迹上的监督热启动和(ii)多轮工具使用轨迹上的代理强化微调(RFT)。关键的见解是,这两个阶段作用于互补的轴上,对经过验证的特权教师跟踪的监督微调 (SFT) 扩展了可解决的问题集(提高了最困难情况下的 pass@k 覆盖率),而 RFT 通过教导模型何时验证、检索哪些证据以及如何从执行反馈修复错误 SQL,将扩展的功能转换为更高的单遍精度。应用于 Gemma 4 指令调整 (31B) 时,仅 RFT 在 BIRD-SQL 开发基准上就实现了 73.66% 的执行准确度 (EX)(自一致性为 74.12% EX)。从 SFT 检查点 (SFT$\to$RFT) 初始化 RFT 会产生我们最强的模型,单程 EX 率为 74.32%,自我一致性为 74.77% EX。截至撰写本文时,这在 BIRD 单模型开发集排行榜上排名第一。该方法使用基于执行正确性的复合奖励,不需要超出基准本身的人工注释,并且在单个密集的 31B 模型中运行,这表明在工具使用轨迹上正确设计的 SFT$\to$RFT 管道是实现强大的企业级文本到 SQL 的实用路径。

ReToolSQL:以智能体强化学习实现稳健的文本到SQL转换:论文配图
图1:ReToolSQL的高级别概览。Gemma 4 31B政策处理一个自然语言问题和丰富的方案,该政策与数据库工具进行多次交流,以产生经核实的SQL。在训练圈中,B1、B2、...B*1},B*2},ldots表示每个训练步骤抽样的速成组(每步都包含G=16G}16个单题多转轨)和R1、R2、...R1},R2},Laldts 轨道级复合奖赏Rkwk RkRsum}wk}Rk}(第3.8节),这些奖项产生团体反向优势,驱动着GROPO的更新。无报酬差异的组(std=0\text{std0)被动态抽样丢弃(第3.5节),因为它们没有提供梯度信号。