论文
大语言模型作为低资源语言的评审:调整拉加斯和罗马尼亚语的比较排名
LLM-as-a-Judge for Low-Resource Languages: Adapting Ragas and Comparative Ranking for Romanian
摘要
评估检索增强生成 (RAG) 系统对于低资源语言 (LRL) 来说仍然是一个挑战,因为基于标准参考的指标在这些语言中存在不足。本文通过使用下一代模型(Gemini 2.5 和 Gemini 3)调整 Ragas 框架,研究了罗马尼亚语“大语言模型作为评审”范式的可行性。我们引入了 AdminRo-Eval,这是一个由母语人士注释的罗马尼亚语行政文档的精选数据集,作为自动评估器基准测试的基本事实。我们比较了三种评估方法——直接评分、比较排名和粒度分解——跨忠诚度、答案相关性和上下文相关性的指标。我们的研究结果表明,评估策略必须是特定于指标的:粒度分解实现了最高的人类忠诚度对齐(Gemini 2.5 Pro 为 96%),而比较排名在答案相关性方面表现优于(90%)。此外,我们还证明,虽然轻量级模型难以应对 LRL 中的复杂推理,但 Gemini 2.5 Pro 架构为自动化罗马尼亚 RAG 评估建立了强大的、可转移的基线。