论文

面向声明-证据可追溯性的证据账本裁定

Evidence-Ledger Adjudication for Claim-Evidence Traceability

智能体系统Agent 动作执行与治理

摘要

AI智能体起草声明的速度,已超过作者核查所引用或检索的证据是否支持这些声明的速度。我们研究证据账本裁定(evidence-ledger adjudication):一种声明-证据可追溯性工作流,将每条声明与一个证据包配对,判定支持关系,并把无支持、相矛盾或混合证据的声明退回给作者。实证核心是一个2,335行的盲测基准,由AVeriTeC、CLIMATE-FEVER和SciFact中的独立外部标签构建。金标关系与源证据标签在预测期间被隐藏,仅在评分时才进行合并。在该基准上,智能体证据账本条件取得0.676的关系准确率和0.601的macro-F1,而最佳非智能体基线分别为0.383的准确率和0.303的macro-F1。它还路由了金标为矛盾、证据缺失或混合证据的声明中的1270/1435条,同时路由了900条有支持声明中的295条。这些结果表明,证据账本裁定能够将异构证据包转化为AI辅助写作的可审计追溯层。

面向声明-证据可追溯性的证据账本裁定:论文配图
图 8:2,335 行广泛外部基准上的代理混淆矩阵。行是外部黄金标签,列是预测关系。