论文

了解何时通过 SFT 和 DPO 推理文本到 SQL

Learning When to Reason for Text-to-SQL via SFT and DPO

模型推理测试时计算扩展

摘要

最近的文本到 SQL 方法严重依赖于以推理为中心的范例,例如思想链 (CoT),以高推理时间开销为代价,在复杂的基准测试上取得了巨大的进步。然而,现实世界中的大部分查询都是简单的查找或聚合,无需多步推导即可解决,这使得强制推理变得浪费。因此,我们提出了 AutoThinkSQL,一个将自动思考机制集成到 Text-to SQL 上的监督 微调 (SFT) 和直接偏好优化 (DPO) 中的框架。我们的方法使模型能够动态绕过简单查询的推理,同时为复杂查询调用深度 CoT。在 Qwen3-Coder-30B-A3B 上,与 Spider 和 BIRD 基准测试中的最佳对应基线相比,我们的方法实现了一致的增益,同时与仅 CoT 生成相比,平均输出词元减少了 24.6% 和 18.3%,平均延迟减少了 17.1% 和 11.5%。进一步的分析表明,该模型学会了将其推理决策与查询难度保持一致。