论文
CARGO:区分参考流程与当前实体事实的生产评测
CARGO: Context-Aware Retrieval-Gated Evaluation of Agentic AI in Production
摘要
基于参考答案的LLM裁判默认参考答案就是目标。在处理工单、资产和账户等动态实体的已部署 Agentic 系统中,最接近的参考往往把正确流程用于另一个实体,拘泥字面的裁判因而把不同标识符、日期和状态误判为错误或幻觉。本文称之为参考—实例分歧(RID)。CARGO把参考视为流程范例,以当前实例的观测上下文判断事实;把主张分为支持、矛盾、无法核验三类,仅惩罚矛盾;再用检索置信度设置评测门控,将生产评测视为选择性预测。CARGO-Bench通过扰动构造已知真值,区分宽容程度与辨别能力。在246项、两个裁判模型、7872次判断中,标准参考裁判惩罚了全部正确的实体替换答案,辨别指数DI约为0;只补当前事实而不重构评判方式没有效果。CARGO消除误罚(0/50),同时保持近乎完整的矛盾召回(50/50和49/50),DI升至0.58,区间为[0.48,0.68]。交换评判量表的对照将主要效果归于有上下文依据的维度定义。但保护实体数值的宽容也降低流程错误检测,召回率仅20%。事后修补未消除缺口,使用书面指南和裁决的LLM标注者研究也呈现相同盲点。作者公开预注册协议,拟把评测扩展到专家一致性、风险—覆盖率及生产流量成本。