论文

ClaimReceipt:验证智能体评估中证据的充分性与覆盖度

ClaimReceipt: Verifying Evidence Sufficiency and Coverage in Agent Evaluations

模型评测评测方法与指标

摘要

代理评估面临两个不同的证据问题:报告的主张是否可以根据保留的证据重新计算(充分性),以及保留的记录是否覆盖已提交的实验集(覆盖率)。通用日志和哈希链接的转录本都不能可靠地回答。我们引入了 ClaimReceipt,这是一种与声明相关的收据规范和选择性验证器,它将键入的交易证据绑定到签名的实验清单,并针对每个声明返回 PASS、INVALID 或 INCONCLUSIVE。我们在实施之前冻结规范(SHA-256 18d109...b81)。在 1,392 条历史买家-卖家记录中,CR-2 验证程序重现了所有 5 个手动标记的审核结论,准确地重播了 600 个确定性记录和 792 个生成后记录,使 13 个声明的字段组中的每一个在测试消融下都变得非冗余,并返回 11/11 语义错误和 0/8 误报的预期结果。然后,我们运行一个单独的预期 CR-3 时期:在推理之前提交 30 项任务,签署并链接终端收据,并为审计员加密私人证据。完整的证据产生覆盖范围和会计通过;扣留一份终端收据将返回 INCONCLUSIVE_COVERAGE,而扣留所有私人空缺可保留覆盖范围和协议验证,但会使经济声明不确定,与预先注册的预测完全匹配。收据检测增加了 0.021% 的模型推理时间,并且每笔交易增加了 9.9 KB。规范易读性探测表明,我们自己的冻结规范对于独立读者来说还不是明确的。因此,声明验证既需要声明充分的证据,又需要一个可以使遗漏变得可见的承诺宇宙。