论文
SQL-Trail:面向Text-to-SQL的交替反馈多轮强化学习
SQL-Trail: Multi-Turn Reinforcement Learning with Interleaved Feedback for Text-to-SQL
摘要
尽管大语言模型(LLM)已大幅改进Text-to-SQL生成,但在BIRD-SQL等具有挑战性的基准上,AI系统与人类专家之间仍存在显著差距。我们认为,这一差距很大程度上源于流行的单次生成范式,它缺乏人类自然采用的迭代推理、模式探索和纠错行为。为突破这一局限,我们提出SQL-Trail,一个面向Text-to-SQL的多轮强化学习(RL)Agentic框架。SQL-Trail不再一次性生成查询,而是与数据库环境交互,并利用执行反馈迭代改进其预测。我们的方法围绕两个核心思想:(i)自适应轮次预算分配机制,使智能体的交互深度与问题难度相匹配;(ii)复合奖励面板,联合激励SQL正确性和高效探索。在各基准上,SQL-Trail创下新的最先进水平,并展现出强大的数据效率——比以往单轮RL最先进方法最高提升18倍。值得注意的是,我们的7B和14B模型平均以5%的优势胜过规模大得多的专有系统,凸显了交互式Agentic工作流对稳健Text-to-SQL生成的有效性。
