论文

Progress-SQL:通过渐进奖励改进文本到 SQL 的强化学习

Progress-SQL: Improving Reinforcement Learning for Text-to-SQL via Progressive Rewards

模型训练强化学习

摘要

强化学习最近在改进 大语言模型 的文本到 SQL 生成方面表现出了希望,但现有方法通常会优化在单个 SQL 状态上定义的一次性奖励。这种奖励对迭代 SQL 修正提供的指导有限,不足以捕获多轮 SQL 细化的改进。在本文中,我们提出了 Progress-SQL,这是一种多轮强化学习框架,可为 Text-to-SQL 提供渐进奖励。我们的方法引入了 Oracle 引导的诊断树 (ODT),它将 SQL 查询抽象为子句级结构配置文件,并为下一轮细化生成诊断反馈。为了提供密集而强大的奖励信号,我们将基于 ODT 的结构对齐与词汇对齐相结合,并定义一个渐进奖励来衡量从初始 SQL 到最终 SQL 的改进。我们进一步结合了有利于早期正确性的进度延迟奖励和鼓励从无效 SQL 中恢复的执行状态奖励。对 BIRD、Spider 和 Spider 鲁棒性变体的实验表明,我们的方法在主要评估和鲁棒性评估中持续提高了文本到 SQL 的性能。