论文
没有理由就没有评判:面向版本化AI评估器的反事实凭单
No Judgment Without a Reason: Counterfactual Receipts for Versioned AI Evaluators
摘要
评估器常常通过有缺陷的推理产出正确的标签,这对把关动作、分流审核或提供训练反馈的智能体系统是关键性失败。标准评估只验证最终标签的正确性,而忽视判断变化是否源于有效证据、一致的规则或恰当的规则适用。我们通过三个核心来源——依据(grounds)、规范(norms)与权威(authority)——形式化评估器推理问责性。变动这些来源产生一个八格反事实判断立方体,用以刻画判断更新。我们把判断凭单定义为能复现修订后结论的最小来源替换集合,用以解释判断转变。我们为黑盒评估器推导认证成本界,并呈现ReasonBench——一个带可验证凭单的政策与逻辑推理基准,覆盖19,520个案例与7,200个对照。在冻结评估中,Qwen3-1.7B达到98.41%的凭单准确率,而立方体预测得分为96.99%,出现一致的1.42分下降,并经Qwen3-0.6B复现验证。高标准准确率掩盖了严重的稳健性缺陷:保义来源置换使直接预测与立方体预测的有效凭单恢复率分别降至54.8%与49.2%。在简单单来源变化上训练的模型保持93.75%的结论准确率,但对复杂多来源更新的凭单恢复率仅7.16%。置换重训将一致性提升至96.6%,却加剧立方体预测的缺陷。结构化反事实监督无法保证稳健推理。我们表明,知因的评估必须解耦预测与认证,在标准准确率之外同时报告变换一致性,以实现可信的评估器审计。
