论文
XLGoBench:通过算法任务检测跨语言技能差距
XLGoBench: Detecting cross-lingual skill gaps with algorithmic tasks
摘要
我们引入了一组综合算法任务来检测 大语言模型 能力的跨语言差距。我们的基准测试是跨语言的,因为它要求模型以不同的语言执行相同的底层任务;可扩展,因为每个任务都可以以不同的复杂程度生成,从而使其能够适应具有不同功能的模型;可量化,因为每项任务都承认客观的正确性概念;而且透明,因为任务是从简单的模板生成的,可以轻松审核翻译错误。由于我们的基准测试侧重于算法任务,因此差异性能是跨语言差距的充分指标,但不是必要指标。尽管如此,我们通过大量的实验表明,我们的基准暴露了多种最先进模型中持续存在的跨语言差距。