论文

干净的分数、隐藏的证据和确信的错误:基于收据的 Frontier Agentic QA 审计

Clean Scores, Buried Evidence, and Confident Wrong: A Receipt-Based Audit of Frontier Agentic QA

模型评测模型行为与机制分析

摘要

前沿模型在浅层文档/图表阅读任务上得分很高。在受控数据室审计中,将证据转移到埋藏条件中会降低准确性,增加强制声明,增加工具调用,并增加每个正确答案的成本。置信度和基准校准没有完全捕获错误答案;记录在案的生产事件表明,捏造的结构声明可以与准确的数字表混合在一起。代理评估需要声明级收据(声明级出处,而不是答案级分数)、条件感知评分和人类对抗性验证——这是一种审计规则,而不是排行榜。我们衡量的环境是财务尽职调查;我们接下来要构建的场景是国防参谋工作,其中会出现相同的埋藏证据形状。在这两种情况下,模型都不是后果的一方;签名的人是。简而言之:在我们检查的记录案例中,代理人可以将准确的数字与自信的捏造解释配对,因此举证责任必须从模型转移到证据追踪。