论文

改进跨全球语言的LLM评估方法

Improving Methodologies for LLM Evaluations Across Global Languages

模型评测安全与风险评测

摘要

随着前沿 AI 模型全球部署,其行为在多样语言与文化语境中保持安全可靠至关重要。为检验当前模型安全防护在此类环境中的表现,国际高级 AI 测量、评估与科学网络的参与者——包括来自新加坡、日本、澳大利亚、加拿大、欧盟、法国、肯尼亚、韩国与英国的代表——开展了联合多语言评估演练。演练由新加坡 AISI 牵头,在覆盖高资源与低资源组的十种语言上测试两个开放权重模型:粤语英语、波斯语、法语、日语、韩语、斯瓦希里语、马来语、普通话与泰卢固语。超过 6,000 个新翻译的提示在五个伤害类别(隐私、非暴力犯罪、暴力犯罪、知识产权与越狱鲁棒性)上评估,同时使用 LLM 作为裁判与人工标注。演练展示了安全行为如何随语言变化,包括跨语言与伤害类别的防护鲁棒性差异,以及评估者可靠性(LLM 裁判对人工复核)的差异。此外,它还生成了改进多语言安全评估的方法学洞见,例如需要文化情境化的翻译、经压力测试的评估者提示以及更清晰的人工标注指南。这项工作代表迈向先进 AI 系统多语言安全测试共享框架的初步一步,并呼吁与更广泛的研究社区和行业持续合作。