论文

DW-Bench:评测LLM的数据仓库图拓扑推理能力

DW-Bench: Benchmarking LLMs on Data Warehouse Graph Topology Reasoning

模型评测基准与评测资源

摘要

本文提出DW-Bench,一个评测大语言模型(LLM)在数据仓库模式上进行图拓扑推理能力的新基准,显式纳入外键(FK)与数据血缘(data-lineage)两类边。该基准包含跨五个模式自动生成、可验证正确的1,046道问题。实验显示,工具增强方法显著优于静态方法,但在困难的组合型子类上趋于停滞。

DW-Bench:评测LLM的数据仓库图拓扑推理能力:论文配图
图 1:所有三个模型的子类型的 EM (%)。通过目标节点标准化,TU 现在的成员资格平均为 71%(Qwen 达到 100%),这表明拓扑枚举完全可以用工具解决。组合的影响保持在0-17%,将组合多跳推理隔离为核心瓶颈。 FT/GA 的 full_enumeration 分数高达 100% (Gemini),因为这些问题是从平面文本和图形增强默认为全局图形查询注入的完整架构上下文中得到回答的。