论文
DataKernelBench:LLM 能否优化 GPU 上的数据库查询?
DataKernelBench: Can LLMs Optimize Database Queries on GPUs?
摘要
GPU 越来越加速数据库系统的速度,但特定于查询的峰值性能仍然常常依赖于手写的内核。现有的 LLM 内核基准测试侧重于机器学习运算符,而没有测试不规则、异构、数据移动密集的数据库式运算符。我们引入了 DataKernelBench,它将 SQL 转换为经过验证的 PyTorch TorchPlan 程序,并评估 LLM,通过执行引导修复来优化核心张量限制片段或 CUDA 或 Triton 中的完整查询。在配备 H100 GPU 的 TPC-H SF10 上的 10 个专有和开放权重模型中,最强大的全查询 CUDA 配置在完全通过率下比 TorchPlan 基准实现了 2.11 美元\倍的加速。我们发现,更高性能的实现通常使用内核融合和执行策略更改,更强大的模型从完整查询专业化中获益最多,并且工作负载上下文比硬件上下文更重要。为了处理大于 GPU 内存的数据,我们使用 Dask-cuDF 扩展了 TorchPlan,以便在具有四个 H100 GPU 的 TPC-H SF100 上实现按需分区加载,实现了 2.54 倍的加速。项目页面:https://kerneldf.github.io/datakernelbench