论文

sk-bench:以原生数据评测斯洛伐克语大语言模型

sk-bench: A Native-First Benchmark for Evaluating Large Language Models in Slovak

模型评测模型训练持续学习基准与评测资源模型能力评测

摘要

多语言 LLM 基准忽略了斯洛伐克语(一种形态丰富的西斯拉夫语言,有 500 万使用者),或者仅通过机器翻译来涵盖它。我们推出了 sk-bench,这是一个本地优先的斯洛伐克基准测试,包含 10 个技能类别的 30 个数据集(33 个评分任务变体)。引入或首次打包了 11 种资源用于生成式 LLM 评估,包括带有斯洛伐克语适应指令检查器的 IFEval-SK 以及用于斯洛伐克语语法和词法的原生 Chiby/SKJ1 资源。我们在一根安全带下评估了 55 个开放式和封闭式权重模型。最佳开放模型落后专有 API 12.6 个百分点。原生和翻译的封闭式数据 ($ρ\geq0.98$) 的模型排名相似,但翻译对最强模型的区分效果较差。相比之下,人工编写的 QA 问题和LLM生成的 QA 问题对模型的排名不同 ($ρ=0.72$)。对于Qwen3-14B,继续斯洛伐克预训练使总分降低了13.9分。一个小的指令集可以弥补四分之三的损失。对于 9B 及以上的模型,测试时推理得分提高了 8.5 至 12.5 分。总之,这些发现为其他资源不足的语言提出了四个设计教训:在翻译失败的地方使用本地数据,在语言适应后计划指令修复,在扩展之前启用测试时推理,并避免在目标语言提示上过度投资。我们在https://github.com/slovak-nlp/sk-bench发布数据和代码