论文

TraceSQL:用于无参考文本到 SQL 验证的可追踪应答性估计

TraceSQL: Traceable Answerability Estimation for Reference-Free Text-to-SQL Verification

模型推理推理验证与自校正

摘要

文本到 SQL 系统通常使用 真值 SQL 查询或参考执行结果进行评估,但在实际部署中的推理时无法进行此类监督。这就产生了一个关键的验证问题:仅给定用户问题、数据库上下文和生成的 SQL,系统能否估计生成的查询是否可能正确回答问题?最近的方法使用 LLM 作为判断或专门代理来检查生成的 SQL,但他们的决策可能很难跟踪。结果奖励模型 (ORM) 通过学习执行标记的候选 SQL 并向未见过的查询分配正确性分数来解决这个问题,但它们仍然对每个验证背后的信号提供有限的可见性。为了解决这个限制,我们提出了 TraceSQL,这是一种基于显式诊断功能构建的轻量级且可追踪的验证模型。 TraceSQL 结合了 67 个功能,可捕获问题歧义、问题要求、问题-架构-SQL 一致性、SQL 结构和意图对齐。这些信号仍然可用于检查哪些因素影响每个预测以及将决策追溯到诊断证据。在 BIRD 开发数据库上,TraceSQL 实现了 66.47% F1 和 64.48% ROC-AUC,而在相同的生成 SQL 评估中,GradeSQL-7B ORM 基线的 F1 为 61.87%,ROC-AUC 为 58.26%。特征归因进一步表明该模型依赖于语义基础和确定性 SQL 结构信号。这些结果表明,可以使用轻量级学习模型执行 SQL 验证,同时保留用于检查和诊断其预测的特征级证据。