论文
SIRIUS-SQL:以执行反馈为锚的多候选Text-to-SQL
SIRIUS-SQL: Anchoring Multi-Candidate Text-to-SQL in Execution Feedback
摘要
在复杂模式(schema)上,Text-to-SQL单次生成并不可靠,因此近来的系统会生成多个SQL候选并用投票过滤错误。然而仅靠投票并不足够,因为多候选方案存在三个相互耦合的弱点:1)从单一生成器中更多采样会产生越来越冗余的候选;2)现有流水线对每个不干净的执行结果套用同一种通用修正,而运行时错误、超时和空结果各自代表着与正确性的不同距离;3)现有选择器依赖单一角度,如结果多数投票或成对SQL比较,会漏掉其他角度本可捕捉的问题。我们提出SIRIUS-SQL,一并解决这三个弱点。一套难度平滑的强化学习方案训练SIRIUS-32B生成多样的可执行SQL候选,并配合一个通用LLM填补专家模型留下的空缺。一个以执行为依据的生命周期机制对每个结果进行分类,并在候选重新进入候选池之前施加针对性修复。一个置信度门控的混合选择器将执行结果一致性同成对SQL形式判断结合起来,仅对近乎持平的案例升级到确定性的结构检查。SIRIUS-SQL在BIRD dev上达到75.88%,在SPIDER test上达到91.20%。三种通用模型配对中有两种超越了Agentar-Scale-SQL——BIRD dev上已发表的最强多候选系统。
