论文
迈向可靠的多语言 LLM-as-a-Judge:一项实证研究
Towards Reliable Multilingual LLMs-as-a-Judge: An Empirical Study
摘要
大语言模型 (LLM) 越来越多地用于生成文本的自动评估,但大多数先前的工作都集中在英语上。尽管对多语言评估的需求不断增长,但将基于 LLM 的评估器扩展到多语言环境仍然具有挑战性,特别是对于资源匮乏的语言和域内数据稀缺的场景。这项工作探讨了开发多语言 LLM 作为法官的几种策略,考虑到域内数据是否适用于 微调。我们系统地分析了英语、西班牙语和巴斯克语,分别代表高资源、中资源和低资源语言,并考虑了指令翻译、单语言与多语言监督以及模型大小。为了进行评估,我们将两个现有的元评估数据集扩展到巴斯克语和西班牙语。我们的结果揭示了关键的权衡:当域内数据可用时,微调的较小模型可以实现与专有模型相当的性能,而使用较大模型的零样本评估在域外设置中被证明更有效。我们还观察到域外数据上的 微调 会对模型性能产生不利影响。这些发现为构建高效、可靠的多语言评估流程提供了实用指导。数据和代码可在 hitz-zentroa/mJudge 上公开获取。