论文
SERL-SQL:用于文本到 SQL 强化代理学习的选择性事后 蒸馏
SERL-SQL: Selective Hindsight Distillation for Text-to-SQL Reinforcement Agentic Learning
摘要
最近的文本到 SQL 系统越来越依赖多轮交互、执行反馈和强化学习。然而,大多数现有方法仅将执行正确性用作轨迹级奖励,这为识别导致成功或失败的 SQL 决策提供了有限的指导。我们提出了 SERL-SQL,一种用于多轮文本到 SQL 代理的基于选择性执行的强化学习框架。 SERL-SQL 对 同策略 SQL 交互轨迹进行采样,并使用仅进行训练的教师通过执行反馈对学生操作重新评分。由此产生的师生似然差距被转换为有界的、屏蔽的权重,仅在 SQL 和工具操作标记上重新加权 GRPO 优势。通过这种方式,任务奖励保留了优化方向,而执行后见之明则提供了本地化的信用分配。在 BIRD、Spider 和跨域基准测试上的实验表明,SERL-SQL 实现了具有竞争力的性能,在 BIRD-Dev 上达到 76.56% 的执行准确率,在 Spider-Test 上达到 89.92% 的执行准确率。此外,我们基于奖励的选择策略非常接近预言机 Best-of-N 上限,并且始终优于基于一致性的选择,这表明 SERL-SQL 产生了高质量的候选者,可以通过轻量级的基于执行的奖励来可靠地识别这些候选者。我们的代码将在 https://github.com/Ffunkytao/SERL-SQL 发布。