论文

什么可以预测文本到 SQL 的正确性?选择性预测研究

What Predicts Correctness in Text-to-SQL? A Selective-Prediction Study

模型评测鲁棒性、公平性与可信度评测

摘要

评估人工智能生成的 SQL 查询的不确定性需要估计查询是否正确,其中正确意味着它执行的结果与人工编写的参考相同。我们研究了哪些信号可以预测硬性多表文本到 SQL 的正确性,使用 AUROC 来衡量每个查询将正确查询排在错误查询之上的程度。在 BIRD 和 Spider 上,字符串、结构和执行自一致性、模式相关性得分和查询可执行性等黑盒信号都落在大约 0.61 到 0.68 AUROC 之间,其中字符串自一致性最强,为 0.675;白盒对数概率类似 (0.67)。超过此上限的信号是基于验证的:LLM 判断分数从 0.72 (GPT-4o-mini) 到 0.78 (Claude)。来自不同提供商的法官会犯不同的错误,因此两个提供商的集成达到 0.82 AUROC,具有良好校准的概率(预期校准误差 0.03),并支持有用的弃权边界(例如,以 24% 的选择性风险回答 27% 的问题),其中自我一致性不提供有效的低风险子集。该模式适用于两个基准、两个生成器和两个判断提供者。我们还询问是否可以训练验证员。经过微调的验证器(编码器和生成器)的 AUROC 分布达到约 0.77 至 0.79,但在未见过的模式上下降至约 0.66;扩展到 7B、增加模式多样性、提炼出强有力的法官理由以及跨基准训练都无法缩小这一差距。跨模式传输似乎跟踪模型规模和推理,而不是 微调。在实践中,文本到 SQL 的正确性不确定性存在于基于推理的信号中:经过微调的验证器是一个很好的域内工具,但跨模式泛化的验证器目前意味着一个大型冻结的推理模型。