论文

通过跨语言对齐预测 LLM 的多语言分类和翻译性能——英语够用吗?

Predicting Multilingual Classification and Translation Performance of LLMs with Cross-Lingual Alignment -- Is English Enough?

模型评测模型行为与机制分析

摘要

当给定语言的表示与模型中的英语更加一致时,多语言 大语言模型 (LLM) 已被证明在非英语分类任务上表现更好。已经提出了几种跨语言对齐(CLA)分数与 LLM 一起使用,以及从模型中提取嵌入的多种方法。我们对 27 个 CLA 分数变体进行了比较分析,检查它们有何不同以及每个变体对三项任务的下游性能的预测效果如何。至关重要的是,虽然 LLM 广泛用于机器翻译等生成任务,但之前的工作几乎完全集中在分类上。因此,我们研究 CLA 分数是否可以类似地预测翻译性能。为了实现跨目标语言的计算相关性,我们提出了一种基于 PMI 的翻译度量,该度量对目标语言的依赖性较小,并且与 chrF 密切相关。我们发现,英语 CLA 预测的翻译质量与源-目标 CLA 相当或更好,这为 LLM 使用英语作为内部枢纽语言提供了新证据。