论文
Manacá-1B:开放、可复制的巴西葡萄牙语语言模型和分词器感知的配对评估
Manacá-1B: An Open, Reproducible Brazilian-Portuguese Language Model and a Tokenizer-Aware, Paired Evaluation
摘要
巴西葡萄牙语的开放语言模型仍然不足,而且现有的少数模型很难复制,并且经常在没有不确定性措施的情况下进行比较。我们发布了 Manacá-1B,这是一个仅开放解码器的模型,包含 17.2 亿个参数,从头开始针对巴西葡萄牙语进行训练,具有完全容器化、可复制的管道。预训练是稳定的,具有零跳过或 NaN 步骤和自我恢复损失峰值,并且我们发布了其完整日志和动态。我们在单个工具下根据四个葡萄牙基准的九个开放基线评估该模型。每次比较都会报告标准误差和配对显着性检验,并根据之前发布的数据对工具进行验证。在最后词预测上,Manacá-1B 是 7B 等级以下最强的模型,超过了 LAMBADA-PT 上的 Tucano-1b1 和 Tucano-2b4,具有较大的配对余量;它在常识性完成方面具有竞争力,在多项选择推理方面几乎有机会,就像所有小型基础模型一样。在此过程中,我们记录了一个具体的评估陷阱:将具有大小写折叠规范化的 SentencePiece 标记器转换为 HuggingFace 快速格式,会默默地丢弃规范器,将每个大写标记路由到字节后备,并以在聚合指标中不可见的方式降低分数。未经校正的分词器将 LAMBADA-PT 准确率从 45.3 降低到 25.0;我们量化了效果并提供了一个可以准确再现训练分词器的单行修复程序。代码、原始训练和评估日志、每个示例的预测向量、模型权重和校正后的分词器均已发布,以便可以重新计算本文中的每个数字。