论文

BADGER:面向生成式企业Text-to-SQL的桥接智能体与确定性评估

BADGER: Bridging Agentic and Deterministic Evaluation for Generative Enterprise Reasoning

模型评测评测方法与指标

摘要

将自然语言转换为 SQL 查询并编排多步骤代理推理管道的企业人工智能系统需要与学术基准完全不同的评估方法。 Spider 和 BIRD 建立了执行精度协议; G-Eval 和 RAGAS 基于 LLM 的高级评估;最近的工作,如 Spider 2.0、BEAVER 和 BIRD-Interact,已经开始解决企业和代理层面的问题。没有一个框架将文本到 SQL 评估与代理行为评估统一到根据人类专家判断进行校准的生产级管道中。我们推出了 Merkle 开发的 BADGER,这是一个集成文本到 SQL 评估与代理行为评估的统一评估框架。 BADGER 提供了三项贡献。首先,LLM 辅助的 SQL 组件提取扩展了 Spider 方法来处理 CTE 较多、特定于方言的 SQL。其次,混合执行准确性指标 (Hybrid-EX) 通过使用 LLM 在确定性单元级评分之前推断结构对齐来解决列别名和数字容差脆弱性。经过 150 个人工注释的行业查询的验证,Hybrid-EX 实现了 Cohen 的 kappa=0.717 [95% CI:0.600-0.822](基本一致)和 87.3% 的平衡准确度,优于所有六个竞争框架(Delta-kappa:0.322-0.502,所有 p<=0.001)。第三,企业代理评估套件将 RAGAS、G-Eval 和代理基准指标组装到统一的管道中;过度使用工具是唯一的新颖元素。 BADGER 完全在客户的受管数据环境中运行,支持可配置的 LLM 法官后端,并支持对特定于客户的法官和指标进行快速原型设计,充当持续的评估骨干而不是一次性的质量门。

BADGER:面向生成式企业Text-to-SQL的桥接智能体与确定性评估:论文配图
图 1:BADGER 与所有评估框架的统计比较面板(n=150n=150;bootstrap N=5,000N=5{,}000)。右上(⋆\star 主要指标):Cohen 的 κ\kappa,引导 CI 为 95%。 Hybrid-EX 达到 κ=0.717\kappa=0.717 [0.600, 0.822](显着),显着优于所有六个基线(Δ​κ\Delta\kappa 范围:0.322–0.502,所有 p≤0.001p\leq 0.001)。根据 Landis & Koch (1977),参考线为中等 (κ=0.40\kappa=0.40) 和大量 (κ=0.60\kappa=0.60) 阈值。左上:原始 EX 平均值 ±\pm 95% CI; Dr. Spider M5 达到 EX = 0.727,但 κ=0.234\kappa=0.234,说明原始 EX 分数不能很好地代表人类对齐。左下:成对 κ\kappa 显着性(bootstrap,N=5,000N=5{,}000);所有 Hybrid-EX 与基线的比较都很显着(绿色)。右下:Cohen 的 κ\kappa 与平衡精度叠加。