将 EngGPT2-16B-A3B 与类似的意大利和国际开源 LLM 进行基准测试
Benchmarking EngGPT2-16B-A3B against Comparable Italian and International Open-source LLMs
摘要
本报告对 ENGINEERING Ingegneria Informatica S.p.A. 的 EngGPT2MoE-16B-A3B LLM 的性能进行了基准测试,该模型是具有 3B 活动参数的 16B 参数专家混合 (MoE) 模型。我们在各种代表性基准测试中对性能进行了研究,并与同等规模的开源 MoE 和密集模型进行了比较。与流行的意大利模型(即 FastwebMIIA-7B、Minerva-7B、Velvet-14B 和 LLaMAntino-3-ANITA-8B)相比,EngGPT2MoE-16B-A3B 在国际基准测试中表现相同或更好:ARC-Challenge、GSM8K、AIME24、AIME25、MMLU 和 HumanEval (HE)。它在 RULER 基准测试的最长上下文设置(32k)下实现了最佳性能。在意大利基准数据集 ITALIC 上,该模型的表现与其他模型一样好甚至更好,但 Velvet-14B 除外,它的表现优于它。与同等大小的流行 MoE 模型相比,新模型在所有考虑的基准上报告的值均高于 DeepSeek-MoE-16B-Chat。它在 HE、MMLU、AIME24、AIME25、GSM8K 和 32k RULER 设置上的值高于 Moonlight-16B-A3B,但在 BFCL 以及某些 ARC 和 ITALIC 设置上的值较低。最后,它在大多数基准测试中的值都低于 GPT-OSS-20B,包括 HE、MMLU、AIME24、AIME25、GSM8K、ARC、BFCL 和 RULER 32k。与流行的密集模型相比,EngGPT2MoE-16B-A3B 在 AIME24 和 AIME25 上报告的值高于 Llama-3.1-8B-Instruct、Gemma-3-12b-it 和 Ministral-3-8BInstruct-2512-BF16,但在 32k 上下文中的 ITALIC、BFCL 和 RULER 上报告的值较低。当汇总所有基准指标的性能时,EngGPT2MoE-16B-A3B 显示出比接受评估的意大利模型更高的性能,但与一些性能最佳的国际模型(特别是 GPT-5 nano 和 Qwen3-8B)相比,其结果较低。总而言之,我们的研究结果发现,新型号是意大利本土 大语言模型 向前迈出的一步。