论文
扩展项目反应理论以实现高效且有意义的多语言评估
Extending Item Response Theory for Efficient and Meaningful Multilingual Evaluation
摘要
多语言基准是跨语言评估 大语言模型 (LLM) 的核心,但它们面临三个问题:详尽的评估规模与语言数量呈线性关系,自动翻译会引入在规模上很容易遗漏的错误,以及一些项目将一般知识和特定文化知识混为一谈。我们使用统一的统计框架 Multilingual-IRT 来解决这三个问题,该框架通过每种语言的难度偏差、将内容与语言效果分开的区分度以及每种语言的能力残差扩展了项目反应理论。在 MMLU-Pro-X 的 29 种语言的 25 LLM 上拟合多语言-IRT,我们表明其拟合参数支持三种实际应用:预测未观察到的(项目,LLM,语言)实例,其二进制交叉熵比最强的基于准确性的基线低 11-16%,显示分布在所有 28 种非英语语言中的候选翻译错误,而基于准确性的基线集中以几种语言进行检测,并恢复基于准确性的基线遗漏的文化特定项目。