论文

QSTRBench:评估语言模型定性时空演算推理能力的新基准

QSTRBench: a New Benchmark to Evaluate the Ability of Language Models to Reason with Qualitative Spatial and Temporal Calculi

模型评测基准与评测资源

摘要

我们提出了一个用于评估大语言模型(LLM)的广泛的定性空间与时间推理(QSTR)基准。我们针对QSTR演算中的Point Algebra(PA)、Allen区间代数、区间与时长(INDU)、区域连接演算(RCC-5、RCC-8与RCC-22)、九交模型、基数方向演算以及STAR,提出了关于组合推理(使用组合表,CT)、逆关系和概念邻域(CN)的问题。RCC-22的CN在此首次发布。一个扩展基准系统地变化问题的呈现方式,包括前缀/中缀、词语/符号/自造术语以及针对所选演算的示意图描述。我们报告了当代前沿模型的结果。所有受测模型的表现都优于随机猜测,但没有一个能持续正确回答所有问题。性能因演算而异、差异悬殊,其中PA最直接简单,RCC-22最难。我们在开放许可下发布了该基准与我们的结果,以便进一步评估LLM中的定性时空推理。

QSTRBench:评估语言模型定性时空演算推理能力的新基准:论文配图
图1:RCC-8在2D中的八个基本关系[20]:DC(断开)、EC(外部连接)、PO(部分重叠)、TPP(相切本征部分)、NTPP(非切向本征部分)和EQ(等于); TPPi 和 NTPPi 分别是 TPP 和 NTPP 的逆,因为它们是不对称的。箭头表示概念上的邻居关系。