论文
EXPO-SQL:文本到 SQL 的基于执行的子句级策略优化
EXPO-SQL: Execution-based Clause-level Policy Optimization for Text-to-SQL
摘要
文本到 SQL 使用户能够通过生成可执行的 SQL 查询来使用自然语言查询数据库。最近的方法越来越多地采用基于 大语言模型 的强化学习 (RL) 来利用执行反馈进行训练。然而,现有的强化学习方法为 SQL 查询中的所有子句分配统一的查询级别奖励,平等对待正确和错误的子句。这种粗粒度的奖励设计导致学习信号不足以正确生成 SQL。为了解决这个问题,我们提出了 EXPO-SQL(基于执行的文本到 SQL 的子句级策略优化),它通过子句级奖励提供细粒度的监督。为了分配子句级别的奖励,我们的方法通过分析执行结果(包括错误消息和逐子句增量执行)来识别错误的子句。对广泛使用的文本到 SQL 基准的实验表明,EXPO-SQL 通过细粒度子句级学习,显着优于现有的监督 微调、提示和基于 RL 的方法。我们的代码可在 https://github 上获取。 com/jhn25/EXPO-SQL。