论文

IndicDB——印度语言的多语言文本到 SQL 功能的基准测试

IndicDB -- Benchmarking Multilingual Text-to-SQL Capabilities in Indian Languages

模型评测基准与评测资源

摘要

虽然 大语言模型 (LLM) 具有显着先进的文本到 SQL 性能,但现有基准测试主要关注西方上下文和简化模式,在现实世界的非西方应用程序中留下了差距。我们推出了 IndicDB,一种多语言文本到 SQL 基准,用于评估跨不同印度语言的跨语言语义解析。关系模式源自开放数据平台,包括国家数据和分析平台(NDAP)和印度数据门户(IDP),确保现实的管理数据复杂性。 IndicDB 由 20 个数据库、237 个表组成。为了将非规范化的政府数据转换为丰富的关系结构,我们采用迭代三代理框架(Architect、Auditor、Refiner)来确保结构严谨性和高关系密度(每个数据库 11.85 个表;连接深度最多 6 个)。我们的管道具有价值意识、难度校准和联合执行,生成了英语、印地语和五种印度语言的 15,617 个任务。我们评估了最先进模型(DeepSeek v3.2、MiniMax 2.7、LLaMA 3.3、Qwen3)在七种语言变体中的跨语言语义解析性能。结果显示,从英语到印度语的性能下降了 9.00%,揭示了由更困难的模式链接、增加的结构模糊性和有限的外部知识驱动的“印度语差距”。 IndicDB 是多语言文本到 SQL 的严格基准。代码和数据:https://anonymous.4open.science/r/multilingualText2Sql-Indic--DDCC/