论文

ModularSQL:针对文本到 SQL 中多重性盲点的运行时护栏

ModularSQL: A Runtime Guardrail for the Multiplicity Blind Spot in Text-to-SQL

模型推理推理验证与自校正

摘要

文本到 SQL 系统越来越多地部署在生产数据库上,其中通过基准评估的查询仍然可能产生扭曲下游工作流程的结果。标准的基于集的执行精度 (Set-EX) 会折叠重复行,因此可能会错过多重错误,包括缺少 DISTINCT、膨胀聚合和笛卡尔式连接爆炸。我们将其称为多重性盲点 (MBS),并引入 Multiset-EX,这是一种暴露此类故障的多重性保留评估标准。在可执行 BIRD-Dev N=1532 上从三个主干(Qwen2.5-Coder-32B、Qwen3-Coder-30B-A3B 和 Gemma-3-27B)发布的 DeepEye-SQL 工件中,我们发现 Set-EX 和 Multiset-EX 之间一致的 5.81--6.79 pp 差距。这一差距并非 DeepEye-SQL 特有的:它在已发布的 DAIL-SQL+GPT-4 (5.22 pp) 和 BIRD GPT-3.5-turbo (3.39 pp) 预测中仍然存在。我们进一步介绍了 ModularSQL,这是一种轻量级的选择后运行时护栏,可探测执行结果中的多重异常,并仅对标记的查询应用确定性补丁或低成本 LLM 救援。 ModularSQL 使用 Qwen3-Coder 与 DeepEye-SQL 集成,将 Set-EX 保持在 72.06%,同时将 Multiset-EX 从 65.86% 提高到 67.75%(+1.89 个百分点)。它标记了 77 个高风险异常,同时仅增加了 0.0076 美元的 LLM 总成本和每个查询 120 毫秒的摊销延迟。跨管道评估表明,无候选检测器和确定性补丁也转移到独立发布的预测集。总的来说,这些结果表明基准测试的准确性并不一定意味着执行安全的 SQL,并且轻量级、多重性感知的运行时护栏可以通过适度的计算开销缩小这一差距。