论文

TQTS-Bench:时间序列数据库上的文本查询的多语法基准

TQTS-Bench: A Multi-Syntax Benchmark for Text-to-Query over Time-Series Databases

模型评测基准与评测资源

摘要

大语言模型(LLM)在关系数据库上具有显着先进的自然语言查询能力,但它们查询时间序列数据库(TSDB)的能力在很大程度上仍未得到评估。现有的基准测试无法充分捕获 TSDB 固有的非统一查询语法、多样化的应用领域以及独特的特定时间查询意图。为了弥补这一差距,我们引入了 TQTS-BENCH,这是一种多语法基准,用于评估 TSDB 上的文本到查询功能。 TQTS-BENCH 包含 6,125 个高质量问答 (QA) 对,涵盖 97 个 TSDB、23 种不同的查询语法、22 个应用领域和 4 种特定时间查询意图。它是通过以人为中心的人工智能辅助工作流程构建的,其中所有 QA 对均由领域专家仔细审查和修订,以确保质量和正确性。对高级LLM和最先进的文本查询方法的广泛评估揭示了查询 TSDB 的挑战。即使是评估的性能最好的模型 Claude-Opus-5,也只能达到 48.98% 的执行准确率,而人类则达到 87.34%。错误分析表明,这种性能差距主要源于不同 TSDB 之间的异构查询语法、对特定时间意图的误解以及不正确的模式链接。这些发现凸显了缩小当前 LLM 能力与实际应用中 TSDB 查询要求之间差距的新机会。该基准可在以下位置获取:https://anonymous.4open.science/r/TQTS-Bench-00CD.