业务真相而非SQL准确率:规则门控的7B分析Agent胜过直接提示的32B基线
Business Truth, not SQL Accuracy: A Rule-Gated 7B Analytics Agent Outperforms a Direct-Prompted 32B Baseline
摘要
LLM 分析智能体以 SQL 语法准确率来评估,但生产故障呈现另一番面貌:一个问题存在两种有效的业务定义、数据仓库无法回答的问题、模式变更后已弃用的列,以及执行成功却返回错误业务数字的查询。没有任何执行匹配指标能为它们打分。本文提出 WarehouseReliabilityBench,一个包含 400 个冻结任务、覆盖两个合成数据仓库的基准,其中约一半的正确响应是一次澄清、弃权或拒绝,采用固定的分母和预注册的配对 bootstrap,在数字出现之前就固定了每个论断动词。QueryProof 是一个 7B 智能体,使用源自语义层和物理目录的规则决定其行为,并对每个答案施加确定性的执行后检查门控。在一次性评估的 80 任务合成测试划分上,QueryProof 以低 71.0% 的每正确答案成本,超过直接提示的 32B 基线 +0.237 [+0.112, +0.375] 的 Business Truth Rate;对阵成本对齐的少样本基线,准确率增益成立但成本差异未能确立。这是在比较系统而非模型规模:32B 基线未获得任何脚手架。假成功从返回答案的 0.754 降至 0.351,且在可回答任务上未返回任何错误数字(24 个中 0 个),尽管有 13 个答案流向了需要澄清或弃权的问题。移除路由层影响甚微(0.562 对 0.537),因此结果不依赖升级机制。在验证集上调优的路由在测试集上过度弃权,拟合的置信度模型输给了它所取代的启发式。对模板族而非任务进行重采样会将两个准确率区间都拓宽到包含零,因此效应方向比其幅度得到更强支持。增益跟随确定性层,但未运行组件消融。