论文

生产环境Text-to-SQL系统中与Agent无关的SQL准确性评估

Agent-Agnostic Evaluation of SQL Accuracy in Production Text-to-SQL Systems

模型评测评测方法与指标

摘要

生产环境中的Text-to-SQL(T2SQL)评估带来了现有基准未能解决的根本性挑战。现有的评估方法——无论是基于规则的SQL匹配还是依赖模式的语义解析器——都假定可以获取真实(ground-truth)查询和结构化数据库模式,而这些约束在真实部署中很少能得到满足。这种脱节使得生产环境的T2SQL agent除开发期测试外基本处于未评估状态,导致质量悄然退化,且缺乏用于持续改进的反馈机制。我们提出STEF(Schema-agnostic Text-to-SQL Evaluation Framework,模式无关的Text-to-SQL评估框架),这是一个生产原生的评估系统,仅依赖自然语言输入——用户问题、一条增强改写和生成的SQL——即可运行,无需数据库模式或参考查询。STEF从自然语言和SQL两种表示中提取语义规格,执行归一化特征对齐,并通过一个涵盖过滤条件对齐、语义判定和评估器置信度的复合指标,产出可解释的0到100准确性分数。关键贡献包括:将增强问题质量验证作为一等评估信号、通过提示模板实现可配置的应用专属规则注入,以及面向生产环境的稳健归一化处理,涵盖GROUP BY容忍、ORDER BY默认值和LIMIT启发式。实证结果表明,STEF能够在不依赖模式的情况下实现持续的生产监控和agent改进反馈闭环,首次使结构化查询评估在大规模场景下切实可行。