论文

Text2GQL-Bench:文本到图形查询语言基准 [实验、分析和基准]

Text2GQL-Bench: A Text to Graph Query Language Benchmark [Experiment, Analysis & Benchmark]

模型评测基准与评测资源

摘要

图模型是具有复杂关系的领域中数据分析的基础。文本到图形查询语言(文本到 GQL)系统充当翻译器,将自然语言转换为可执行的图形查询。此功能允许大语言模型(LLM)直接分析和操作图数据,将其定位为图数据库管理系统(GDBMS)的强大代理基础设施。尽管最近取得了进展,但现有数据集通常在领域覆盖范围、支持的图形查询语言或评估范围方面受到限制。由于缺乏高质量的基准数据集和评估方法来系统地比较不同图查询语言和领域的模型能力,文本到 GQL 系统的进步受到阻碍。在这项工作中,我们提出了 Text2GQL-Bench,这是一个统一的文本到 GQL 基准测试,旨在解决这些限制。 Text2GQL-Bench 将具有跨越 13 个领域的 178,184 个(问题、查询)对的多 GQL 数据集与可生成不同领域、问题抽象级别和具有异构资源的 GQL 的数据集的可扩展构建框架相结合。为了支持全面的评估,我们引入了一种超越单一端到端指标的评估方法,联合报告语法有效性、相似性、语义对齐和执行准确性。我们的评估揭示了 ISO-GQL 生成中的明显方言差距:即使是强大的大语言模型,在零样本设置中也最多只能实现 4% 的执行准确性 (EX),尽管固定的 3 样本提示将准确性提高到 50% 左右,但语法有效性仍然低于 70%。此外,经过微调的 8B 开放权重模型达到了 45.1% EX 和 90.8% 语法有效性,这表明大部分性能跳跃是通过接触足够的 ISO-GQL 示例来解锁的。

Text2GraphQuery-Bench:一个文本到图查询基准
图3:框架总览。我们的数据集构建框架通过 4 个阶段从异构数据源构建 Text-to-GQL 数据集:(i) Schema Translation & Generation(模式翻译与生成):将现有数据集模式转换为图模式,并为通用领域子集生成模式;(ii) Data Conversion & Generation(数据转换与生成):在给定的图模式上转换现有数据或合成数据,以在目标 GDBMS 上创建可执行的图数据库实例;(iii) Query Translation & Generation(查询翻译与生成):通过从现有 Cypher 或 SQL 查询的自动翻译以及基于 LLM 的合成,生成可执行的 GQL 查询;(iv) Hierarchical Question Generation(层次化问题生成):在不同的问题抽象层次上为 GQL 查询添加标注。