论文

衡量跨语言理解差距:证据语言如何塑造语言模型理解的内容

Measuring the Cross-Lingual Comprehension Gap: How the language of the evidence shapes what language models understand

模型评测鲁棒性、公平性与可信度评测

摘要

语言模型通常被评估为当相同的内容以其他语言呈现时,以英语展示的功能仍然同样可用。传统的多语言基准很少在保持内容、问题、参考答案、模型和评估单元不变的情况下隔离语言。我们将跨语言理解差距 (CLCG) 定义为当相同的内容和问题以目标语言而不是英语呈现时,响应质量的下降。我们使用 ParallelQA-18(一个专业人工翻译的平行语料库),对来自 5 个实验室的 5 个模型进行了评估,对 18 种语言的 150 篇文章的分层样本进行了评估(英语参考文献;葡萄牙语高资源基线;涵盖 Joshi 等人 2020 年 0-4 类的 16 个目标)。项目内设计仅改变段落语言。主要估计器将英语与汇总目标语言 Token-F1 微均值在较高复杂性开放式问题上与文章簇引导间隔进行对比。主要汇总 CLCG 为 0.078 (95% CI 0.072-0.084),相对于英语分数降低约 17%;等语言宏观总结为0.077。扣除葡萄牙语后,宏观差距为 0.016(95% CI 0.013-0.020)。语言级 CLCG 与 Joshi 资源类负相关(rho = -0.594,p = 0.015,n = 16)。在盲法配对人类评估中,61.6% 的决定性判断会优先选择较高资源的响应(估计偏好概率 0.655,95% CI 0.558-0.741)。不应假定以英语显示的能力同样可以转移到其他语言;以英语为中心的评估可能会高估资源匮乏语言用户的质量。