论文
ProcArena:LLM 自然语言直接和交互式 PL/SQL 开发的多场景基准测试
ProcArena: A Multi-Scenario Benchmark for LLMs on Direct and Interactive PL/SQL Development from Natural Language
摘要
大语言模型 (LLM) 在将自然语言 (NL) 需求转换为 PL/SQL 程序方面表现出了强大的潜力,吸引了数据库社区越来越多的关注。然而,现有的 NL 到 PL/SQL 工作主要集中于从完整的 NL 需求直接生成 PL/SQL。在实践中,PL/SQL开发涉及从头开发、代码修改、调试、优化等多种场景,可能需要直接生成,也可能需要多轮交互。然而,还没有全面的基准测试能够评估多场景、直接和交互式以及多方言 NL 到 PL/SQL 开发。在本文中,我们介绍了 ProcArena,这是一个基于执行的基准测试,涵盖直接模式和交互模式。 ProcArena 包含超过 157 个数据库的 3,998 个可执行任务,涵盖 PostgreSQL 和 Oracle 的九个开发子场景。我们通过迭代逻辑增强和特定于场景的适配器构建具有挑战性的直接任务,并通过知识集成和需求扰动派生配对的交互式任务,同时保留可执行目标。我们进一步设计了一个受控的求解器-用户模拟器协议,该协议允许模型阐明用户意图并检查数据库环境,而不会暴露隐藏的执行反馈。通过评估七种语言模型,我们发现直接和交互式的最佳平均分数分别仅为 62.2% 和 57.8%,这表明现实的 NL 到 PL/SQL 开发仍然具有挑战性,特别是在交互式设置中。