论文

通过 Bielik v3 7B 和 11B 系列中的分词器优化推进波兰语建模

Advancing Polish Language Modeling through Tokenizer Optimization in the Bielik v3 7B and 11B Series

模型训练预训练

摘要

Bielik v3 PL 系列的开发包含 7B 和 11B 参数变体,代表了特定语言 大语言模型 (LLM) 优化领域的一个重要里程碑。虽然通用模型通常表现出令人印象深刻的多语言功能,但它们经常遭受基本架构效率低下的困扰:通用标记器的使用。这些分词器通常旨在涵盖广泛的语言,但通常无法捕获波兰语等特定语言的形态细微差别,从而导致生育率更高、推理成本增加以及有效上下文窗口受限。本报告详细介绍了 Bielik v3 模型从通用的基于 Mistral 的标记化到专门的波兰语优化词汇的过渡,探索了基于 FOCUS 的嵌入初始化、多阶段预训练课程,以及随后的 后训练 对齐,其中包括监督 微调、直接偏好优化和通过组相对策略优化进行强化学习(具有可验证的奖励)。