论文
AuthTrace:诊断主题密集的单作者语料库中的证据构建
AuthTrace: Diagnosing Evidence Construction in Thematically Dense Single-Author Corpora
摘要
证据构建——决定哪些段落在生成开始之前到达语言模型的阶段——是逐个范式进行评估的,使得实践者没有原则性的方法来诊断哪个组织策略失败、在哪里失败或为什么失败。我们引入了 AuthTrace,这是一个建立在主题密集的单作者语料库上的诊断基准,其中几乎错过的干扰因素与所需证据共享风格、主题和词汇。 AuthTrace 提供明确引用的证据、精确的扇入注释以及衡量证据召回率、证据精确度和答案正确性的统一包级协议。扇入梯度(支持答案所需的源文档数量)作为主要诊断轴,可以在检索、记忆、图形和结构化证据范式之间进行受控比较。通过评估两个 QA 模型中的八个系统,我们发现证据回忆是在主要读者-判断对下观察到的最强的答案正确性预测因子 (r = 0.96);大多数失败源于证据缺失而不是答案综合。扇入进一步暴露了范式特定的崩溃模式:平面检索的退化速度比主题组织的证据构建快 2-3 倍。这些结果表明,扇入分解是一个可重复使用的诊断镜头,用于识别证据构建系统的失败位置以及哪种范式最适合给定的工作负载。