论文
在匹配证据条件下诊断长上下文和检索增强语言模型中的证据利用
Diagnosing Evidence Utilization in Long-Context and Retrieval-Augmented Language Models under Matched Evidence Conditions
摘要
最终答案准确性、检索回忆和引文重叠并不能揭示长上下文或检索增强语言模型实际上从提供的证据中恢复了多少答案优势。模型可能会根据参数先验进行回答,无法使用现有的证据,或者引用相关文本而不将其转换为最终答案。本文介绍了在匹配示例、模型、提示和评分规则下进行证据利用评估的四条件诊断协议。该协议比较无证据、完整上下文、检索证据和预言机证据参考条件,并使用预言机参考标准化上下文利用率 (ONCU) 作为恢复的预言机参考证据优势的分母有效估计。该实证研究通过 Controlled-ONCU-safe16K、HotpotQA-ONCU 和 2WikiMultiHopQA-ONCU 评估了来自 Qwen、Gemma、Llama 和 Mistral 系列的五个局部开放权重模型,包括 18,000 个与 ONCU 兼容的预测。结果显示了一种依赖于任务的诊断模式:当相同的证据嵌入长输入而不是紧凑地提供时,受控的合成设置会导致恢复率降低,而现实的多跳重建表明,全上下文输入在无分母答案和证据指标方面优于测试检索的输入,ONCU 支持预言机改进组的相同方向。具有更强检索设置的敏感性审核缩小了一些差距,但不会推翻范围解释。因此,主要贡献不是单一的利用率,而是匹配的诊断协议,该协议将无证据可回答性、预言证据可恢复性、全上下文恢复、检索条件恢复、分母有效性和伴随答案/证据诊断分开。