论文

匈牙利制造:对生成语言模型性能的评论

Made in Hungary: Comments on the performance of generative language models

模型评测模型能力评测

摘要

近年来,匈牙利出现了三项开发生成语言模型的举措。他们背后的动机是相同的。对于匈牙利语,不存在具有给定能力的模型,或者现有的以英语为中心的模型提供的熟练程度有限。然而,对相应研究的详细检查揭示了一些方法学局限性。首先,评估方案的可靠性值得怀疑。与 Csibi 等人的研究结果相反。 [2026],在推荐的推理设置下的评估表明,Qwen3-4B 比其匈牙利语改编版本 Racka-4B 获得了更高的分数。 Yang 等人的工作中数据污染很明显。 [2025d] 和 Szentmihályi 等人。 [2025],报告的结果可能存在偏差。其次,训练管道达不到当前语料库管理和数据混合方面的最佳实践,这可能会在低质量数据上浪费大量计算。缺乏受控消融阻碍了对这些选择的可靠评估。第三,这三篇论文都没有评估遗忘或能力丧失。在原始基准的子集上测试调整后的模型表明,所有三种情况下的性能均下降,尤其是 Racka-4B。考虑到所涉及的巨大计算和财务成本,这些观察结果强调了语言模型开发中严格实验设计的重要性。