论文

PLSQLBench:可执行过程数据库编程的 LLM 系统基准测试

PLSQLBench: Benchmarking LLM Systems for Executable Procedural Database Programming

模型评测基准与评测资源

摘要

据我们所知,我们提出 PLSQLBench,这是评估 LLM 是否可以编写可执行 PL/SQL 程序的第一个基准,并通过基于执行的测试来衡量正确性。现有的 LLM 评估主要针对通用代码生成或声明性文本到 SQL,而未充分探索过程数据库编程。 PLSQLBench 包含 2,865 个实例:2,594 个单轮任务和 271 个跨 978 个轮的多轮对话。该基准测试结合了企业级 Spider 2 数据库上复杂的基于模式的任务、源自 Spider 的更简单的基于模式的任务以及源自 MBPP 的程序问题,涵盖了不同级别的数据库基础和程序复杂性。使用 8 个 LLM 进行的实验揭示了模式基础、PL/SQL 方言保真度、过程控制流、异常处理和交叉一致性方面反复出现的困难。工具增强的 LLM 代理提高了多个基于模式的评估的性能,尽管仍然存在很大的差距。这些结果突出了未通过传统代码生成或文本到 SQL 基准测试直接评估的过程数据库编程能力。我们的代码可从 https://github.com/oracle-samples/plsqlbench 获取。