论文
AGO AI 质量门:检索增强生成的证据优先发布决策
AGO AI Quality Gate: Evidence-First Release Decisions for Retrieval-Augmented Generation
摘要
采用检索增强生成 (RAG) 的企业面临着一个反复出现的运营决策:升级、修改或阻止系统版本。证据不完整,指标来自容易犯错的大语言模型评审。我们报告 AGO AI 质量门 (AGO),这是一种部署在工业 RAG 评估活动中的证据优先质量门框架。 AGO 集成了四个关键组件:四状态决策模型,将丢失数据和判断错误视为明确的结果;分层评分结合确定性检查、局部护栏和结构化 LLM 评估;分层贝塔二项式门,以概率方式量化回归风险;以及一个强制性的元评估协议,用于在大语言模型评审影响决策之前对其进行验证。由于项目数据是专有的,我们在 RAGBench 上评估判断层,RAGBench 是跨 12 个数据集的 10 万条带注释的 RAG 跟踪的公共基准。在相同的分层测试样本(每个评审 N=1200)上,低成本评审 (gpt-4.1-nano) 检测到的不遵守答案的能力仅略高于随机水平 (AUROC 0.603 [0.570, 0.634]),尽管产生了完美的协议输出,而 gpt-4o 达到了 0.783 [0.756, 0.807]——但其每个域的性能仍然在0.62 至 0.88。涵盖回归、不变和改进的固定种子门研究量化了不安全升级、误报成本和改进吞吐量。在回归下,决策级配置文件将不安全升级降低至 22.2%-35.1%,而幼稚门则为 29.3%-41.8%。这些结果支持设计选择,即评审质量必须按每个项目测量,并且点估计本身并不是发布决策。