论文

更多的主张,更少的证据:人工智能生成的数字知识制品的有限验证

More Claims, Less Evidence: Bounded Verification of AI-Generated Digital Knowledge Artifacts

模型评测评测方法与指标

摘要

数字图书馆、存储库和人工智能介导的知识服务越来越依赖生成系统来生成摘要、描述和其他多声明知识对象。然而,生成比验证容量更容易扩展:审阅者可能需要在仅检查其声明的一小部分后决定对象是否适合发布或下游使用。这在声明级别验证和对整个对象的信心之间造成了根本性的差距。因此,核心问题是,当整个工件的大小增长但验证预算却没有增长时,成功的部分检查对完整工件的可靠性意味着什么。本文贡献了一个以通过预测值(PVP)为中心的有界验证贝叶斯模型。该模型预测,证据价值随着工件在固定验证容量下的增长而降低,随着验证预算的增加而提高,并且在错误稀疏时尤其脆弱。对 FEVEROUS 和 FEVER 的对照实验支持了这些预测,并表明在固定数量的错误或不受支持的声明周围添加受支持的声明可以使通过的可能性更大,同时使通过的信息更少。该模型进一步产生维持目标 PVP 所需的最低验证预算,为人工智能辅助的质量保证工作流程提供实用组件,其中生成的知识对象必须在发布或下游使用之前进行检查。

更多的主张,更少的证据:人工智能生成的数字知识制品的有限验证的原论文方法或结果图
图 1:AI 生成的数字知识工件的有界验证。随着工件大小在固定的验证容量下增长,不受支持的声明可能会在受支持的声明中被稀释,因此部分检查提供了后验证据,而不是整个对象可靠性的证书。