论文

窗口不包含的内容:在基于文档的不稳定基准中审核来源

What the Window Does Not Contain: Auditing Provenance in a Document-Grounded Instability Benchmark

模型评测基准与评测资源

摘要

对同一个文档向语言模型提出相同的问题二十次,有时会返回两个不同的答案。我们建立了 Probity,这是一个由来自真实风险融资文件的 60 项任务和 470 项项目组成的基准,来衡量这种情况发生的频率。然后,我们审核了自己的语料库,发现任何摘录构建的基准都可能存在缺陷:模型显示的文本窗口中缺少证据的项目。审核标记了 36 个项目,并区分了单个标记会合并的两个失败:窗口中确实不存在的证据以及必须根据窗口确实提供的数字计算出的答案。标记项目改变答案的频率要高得多,在 427 个干净项目上,答案的变化幅度为 0.255,而排除它们则会使明显的跨模型一致性降低约五分之一。在测试缺失的证据是否解释了不稳定性之前,我们进行了一个预测:重新切割每个窗口以保留其证据,并且不稳定性应降至设定的阈值以下。它失败了:修复将摆动移动了 0.058,且间隔包含零。我们将这种关联报告为相关性。几乎所有测量都位于无法显示不稳定性的地方,这限制了为准确性而构建的语料库可以描述的稳定性。我们发布语料库、所有 112,800 个原始回复以及审计,作为任何文档基准的可运行检查。