论文

LLM 可以标准化数据库吗?模式标准化的基准和多代理框架

Can LLMs Normalize Databases? A Benchmark and Multi-Agent Framework for Schema Normalization

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地用于生成结构化输出,但当这些输出必须满足数据库级约束时,其可靠性仍不清楚。我们通过数据库规范化来研究这个问题,包括函数依赖性、无损连接分解和表间约束的推理。我们引入了数据库标准化基准 (DNBENCH),其中包含 3,275 个样本,用于评估 LLM 驱动的从 1NF 到 BCNF 的数据库标准化。 DNBENCH 使用三轴协议来衡量语义等价性、结构准确性和逻辑有效性。在单一、复杂和现实世界级别,DNBENCH 揭示了依赖推理、模式分解和表间约束重建中反复出现的故障。我们进一步提出了模式多代理推理(MARS),它将证据提取、违规诊断和分解规划与模式生成和验证分开。 MARS 将 DNB-SCORE 比单提示基线提高了 82.0%。所有工件将在接受后发布。