论文
TRUST-SQL:面向未知模式Text-to-SQL的工具集成多轮强化学习
TRUST-SQL: Tool-Integrated Multi-Turn Reinforcement Learning for Text-to-SQL over Unknown Schemas
摘要
文本到 SQL 解析在完整模式假设下取得了显着的进步。然而,这个前提在现实的企业环境中失败了,因为数据库包含数百个带有大量嘈杂元数据的表。代理必须主动识别和验证相关子集,而不是预先注入完整的模式,从而产生我们在这项工作中研究的未知模式场景。为了解决这个问题,我们提出了 TRUST-SQL(通过工具对未知模式进行真实推理)。我们将任务制定为部分可观察的马尔可夫决策过程,其中我们的自主代理采用结构化的四阶段协议来在经过验证的元数据中进行推理。至关重要的是,该协议为我们新颖的双轨 GRPO 策略提供了结构边界。通过应用token级别的隐藏优势,该策略将探索奖励与执行结果隔离开来解决贡献归因问题,相对于标准 GRPO 提高了 9.9%。跨越五个基准的大量实验表明,TRUST-SQL 的 4B 和 8B 变体相对于其基本模型分别实现了 30.6% 和 16.6% 的平均绝对改进。值得注意的是,尽管完全在没有预加载元数据的情况下运行,我们的框架始终匹配或超过依赖于模式预填充的强大基线。
