论文

T2S-Metrics:用于评估自然语言生成的 SPARQL 查询的统一库

T2S-Metrics: Unified Library for Evaluating SPARQL Queries Generated From Natural Language

模型评测评测方法与指标

摘要

通过知识图对问答(QA)系统进行评估历来都存在碎片化、不一致和可重复性有限的问题。虽然语义解析和 SPARQL 查询生成方面取得了重大进展,但评估方法仍然多种多样、临时性的,并且在不同研究中通常无法比较。现有的基准测试通常关注一小部分指标,例如查询精确匹配或答案级别 F1,而忽略语法有效性、语义 忠实性、执行正确性、结果排名质量和计算效率。在本文中,我们提出了 t2s-metrics,这是一个开源、可扩展且统一的评估库,专为 SPARQL 查询比较和基于执行的评估而设计。 t2s-metrics 提供了一套广泛且可扩展的评估指标,包括 20 多个评估指标,这些指标是从文献和实际评估需求中收集的,涵盖词汇、句法、语义、结构、基于执行和基于排名的维度。其中包括基于查询的指标,例如 词元级 Precision、Recall 和 F1; BLEU、ROUGE、METEOR 和 CodeBLEU 变体;变量归一化指标(SP-BLEU、SP-F1);基于图和基于 URI 的精确匹配指标;以及基于答案集的指标,例如 F1-QALD 和 Jaccard 相似度;排名指标包括 MRR、NDCG、P@k 和 Hit@k;和 LLM-as-a-Judge 指标。受信息检索 ir-metrics 库的启发,t2s-metrics 提供了一个模块化抽象层,将指标规范与实现分离,从而实现对基于 SPARQL 的 QA 系统的一致、透明和可重复的评估。我们认为,t2s-metrics 构成了对知识图问答进行系统化、标准化评估的必要步骤,并有助于对答案正确性之外的系统行为进行更深入的诊断洞察。