论文
审计与修复生产 Text-to-SQL 流程中的 LLM 裁判失效
Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline
摘要
生产 Text-to-SQL 流程经常以一个 LLM 裁判收尾,却从未真正测过它与人工标注者的一致性。作者审查自己的系统时发现,部署的 gpt-4o-mini 裁判与两位作者形成的金标准,在富集分歧样本上 Cohen κ 仅为 0.04,在均匀随机抽查中为 0.42;在富集集合中,它把 77.1% 的人工 FAITHFUL 案例过度标为问题。大部分误报可追溯到一个被称为 GRADE-HALLUCINATION 的机制。自托管 Qwen3.6-27B 替代模型达到 κ=0.72,与 Claude Opus 4.7 的 0.71 相近;n=96 的直接对比统计功效不足,但对部署决定影响有限,因为 Qwen 每次调用成本约为其 1/300。集成并非无代价地改善:将弱裁判与强裁判组合会降低一致性;三个强裁判采用一致同意路由时,在 89.7% 自动覆盖率下达到 κ=0.79。迁移到域外后,同一审计方法按作者的标注协议,将 BIRD-financial 中 25.5% 的专家编写金标准 SQL 标为潜在问题。代码及预注册公开于 https://github.com/JamesL404/synca-audit。
