论文

首届 ChineseBabyLM 挑战赛:训练数据高效且认知合理的中文语言模型

The First ChineseBabyLM Challenge: training data-efficient and cognitively plausible language models for Chinese

模型评测基准与评测资源

摘要

本文介绍了作为 NLPCC 2026 一部分组织的首届 ChineseBabyLM 挑战赛。该挑战赛要求参​​与者使用不超过 1.02 亿中文单词从头开始训练语言模型。这些模型在三个方面进行评估:自然语言理解、认知一致性和汉字知识。对分词器、模型架构或训练纪元的数量没有限制。 18 个团队提交了 28 个不同的模型,生成 74 个结果文件。总冠军团队使用了 DeBERTa-v2 架构,并在预训练期间引入了辅助拼音预测目标。一些提交的内容还探讨了课程学习策略和架构创新。总体而言,该挑战为推进数据高效且认知合理的中文建模方法提供了基准。