论文
DW-Bench:评测LLM的数据仓库图拓扑推理能力
DW-Bench: Benchmarking LLMs on Data Warehouse Graph Topology Reasoning
摘要
本文提出DW-Bench,一个评测大语言模型(LLM)在数据仓库模式上进行图拓扑推理能力的新基准,显式纳入外键(FK)与数据血缘(data-lineage)两类边。该基准包含跨五个模式自动生成、可验证正确的1,046道问题。实验显示,工具增强方法显著优于静态方法,但在困难的组合型子类上趋于停滞。
