论文

在推理时选择正确的语言模式以实现多语言可靠性

Choosing the Right Language Mode at Inference Time for Multilingual Reliability

模型推理测试时计算扩展

摘要

多语言 大语言模型 通常很难用中低资源语言进行推理。先前的工作表明,翻译可以通过帮助模型获得更强大的以英语为中心的表示来改善多语言推理。这就提出了一个核心问题:多语言 大语言模型 需要多少翻译才能可靠地推理,而更多的翻译何时会引发干扰和过度自信?使用 LLaMA 和 Qwen 模型,我们进行了不同文本范围和语言模式(仅限目标、仅限英语、双语)的广泛实验,以评估准确性和可靠性。我们的结果揭示了一个明显的权衡:英语上下文通常可以改善理解并恢复由非英语理解引起的错误,但添加冗余的双语上下文会加剧干扰。我们通过可靠性感知自适应推理 (RAAI) 来解决这种权衡问题,这是一个 无需训练 测试时框架,它 (i) 执行预期校准误差 (ECE) 感知路由和提示融合,(ii) 使用中间层风险指数 (RI) 来控制顺序推理,仅在可能有帮助时分配计算并抑制有害的双语冗余。在两个模型系列中,RAAI 将低资源语言的准确性提高了 25-37.7%,并将校准误差降低了约 3-6%,其中在资源最低的语言层中的优势最为明显。