论文

L3Cube-IndicQuest v2:用于评估跨印度语言的 大语言模型 事实知识的大规模多语言基准

L3Cube-IndicQuest v2: A Large-Scale Multilingual Benchmark for Evaluating Factual Knowledge of Large Language Models Across Indic Languages

模型评测基准与评测资源

摘要

我们推出了 L3Cube-IndicQuest v2,这是一个大规模的金标准标准多语言问答基准,用于评估 大语言模型 (LLM) 的印度特定事实知识。该基准包括 3,471 个基于课程的英语问答对,涵盖九个领域,由教育课程、竞争性考试材料和特定领域的参考书整理而成。我们引入了一种实用的混合构建策略,它将基于上下文的 LLM 问题生成和验证与语义重复数据删除和人工验证相结合,从而能够在保持注释质量的同时可扩展地创建基准数据。该基准被翻译成 19 种印度语言,产生了一个公开发布的多语言数据集,其中包含 20 种语言的 69,420 个问答对。我们在三种协议下评估六个 LLM:LLM-as-a-judge 和两个确定性词汇标准,精确子串和单词重叠匹配。这三个模型的排名几乎相同,这表明结果并不取决于评委的选择。前沿商业模型大幅领先,在开放重量模型中,Gemma4 31B 在每种评估的印度语中都优于印度语专用 Sarvam 30B。