论文

问答模型的上下文长度鲁棒性:一项对比实证研究

Context-Length Robustness in Question Answering Models: A Comparative Empirical Study

模型评测上下文与知识上下文工程鲁棒性、公平性与可信度评测

摘要

大语言模型越来越多地被部署在相关信息嵌入长且嘈杂上下文的场景中。尽管如此,模型对上下文长度增长的鲁棒性在不同问答任务中仍缺乏充分理解。在本工作中,我们使用两个广泛使用的基准SQuAD和HotpotQA,对大语言模型的上下文长度鲁棒性进行了受控实证研究。我们通过在保留含答案信号的同时系统性地增加无关上下文数量,将模型准确率作为总上下文长度的函数进行评估。这使我们能够将上下文长度的影响与任务难度的变化分离开来。结果显示,随着上下文长度增加,性能持续退化,且多跳推理任务中的下降显著大于单跨度抽取任务。特别是在同等上下文扩展下,HotpotQA的准确率下降幅度接近SQuAD的两倍。这些发现凸显了鲁棒性的任务依赖差异,并表明多跳推理对上下文稀释尤为脆弱。我们认为,在评估模型可靠性时应显式评估上下文长度鲁棒性,尤其是对涉及长文档或检索增强生成的应用。

问答模型的上下文长度鲁棒性:一项对比实证研究:论文配图
图 1:用于评估上下文长度稳健性的受控上下文构造。对于每个问题,在所有设置中都会保留带有答案的信号段,同时添加越来越多的不相关上下文以达到目标上下文长度。这种设计隔离了总上下文长度的影响,同时保持可用证据固定。