论文
Text2GQL-Bench:文本到图形查询语言基准 [实验、分析和基准]
Text2GQL-Bench: A Text to Graph Query Language Benchmark [Experiment, Analysis & Benchmark]
摘要
图模型是具有复杂关系的领域中数据分析的基础。文本到图形查询语言(文本到 GQL)系统充当翻译器,将自然语言转换为可执行的图形查询。此功能允许大语言模型(LLM)直接分析和操作图数据,将其定位为图数据库管理系统(GDBMS)的强大代理基础设施。尽管最近取得了进展,但现有数据集通常在领域覆盖范围、支持的图形查询语言或评估范围方面受到限制。由于缺乏高质量的基准数据集和评估方法来系统地比较不同图查询语言和领域的模型能力,文本到 GQL 系统的进步受到阻碍。在这项工作中,我们提出了 Text2GQL-Bench,这是一个统一的文本到 GQL 基准测试,旨在解决这些限制。 Text2GQL-Bench 将具有跨越 13 个领域的 178,184 个(问题、查询)对的多 GQL 数据集与可生成不同领域、问题抽象级别和具有异构资源的 GQL 的数据集的可扩展构建框架相结合。为了支持全面的评估,我们引入了一种超越单一端到端指标的评估方法,联合报告语法有效性、相似性、语义对齐和执行准确性。我们的评估揭示了 ISO-GQL 生成中的明显方言差距:即使是强大的大语言模型,在零样本设置中也最多只能实现 4% 的执行准确性 (EX),尽管固定的 3 样本提示将准确性提高到 50% 左右,但语法有效性仍然低于 70%。此外,经过微调的 8B 开放权重模型达到了 45.1% EX 和 90.8% 语法有效性,这表明大部分性能跳跃是通过接触足够的 ISO-GQL 示例来解锁的。
