论文

当下与过往:评测大语言模型的时序演化文档理解能力

Time Present and Time Past: Benchmarking Large Language Models on Temporally Evolving Document Understanding

模型评测基准与评测资源

摘要

法律、税则和软件文档等演化文档会随时间被修订、替换,有时还会回退,因此同一个问题在不同日期有不同的正确答案。与百科知识中旧事实被简单覆盖不同,修订本身是一份官方文本,它说明所取代的内容及生效时间,而更早的版本在其有效期内仍然正确。因此核心挑战是版本解析,即确定查询日期所生效的版本。现有时序问答数据集仅把时间当作一种标注,因此版本解析始终未被测试。我们提出TIDE,一个经专家校验的基准,包含3,050个问答对,覆盖孟加拉国政府1969年至2025年间发布的644份官方海关文件,涵盖八种任务类型,这些文档深度混杂多种语言、版式各异并以两种历法标注日期。此外,我们在统一协议下评估九个近期大语言模型,覆盖参数化、金标准上下文和检索三种访问方式,由三个裁判组成的大语言模型委员会评分,并设硬性日期闸门将语义正确与时间正确区分开。最佳宏平均准确率仅为68.5%。根据隐含日期解析版本达到59.7%,而检测所提供版本不适用于该查询仅为26.7%。模型找到正确版本的可能性高于拒绝错误版本,且它们倾向于遵循自信的参数化答案而非所提供的权威文本。全部代码与数据见 https://github.com/icsetepa44/TIDE

当下与过往:评测大语言模型的时序演化文档理解能力:论文配图
图 1:传统不断发展的知识和不断发展的文档的比较。