论文

正确的工具,正确的工作:母语评估、分词器敏感性以及仅法语 BabyLM 的方法论发现

Right Tool, Right Job: Native-Language Evaluation, Tokenizer Sensitivity, and Methodological Findings from a French-Only BabyLM

模型评测评测方法与指标

摘要

我们向 BabyLM 2026 Strict 赛道提交了 MéTRON-FR,这是一个针对 9247 万法语单词进行预训练的 125M GPT-2。它在 QFrBLiMP(魁北克法语本地语法最小对基准)上得分为 85.97 +/- 0.17%,在 BabyLM 加权排行榜上得分为 62.80%。跨语言 GLUE(通用语言理解评估)协议将法语任务数据翻译与 16 阶 LoRA(低秩适应)相结合,产生了尖锐的任务类型梯度:关系任务显着增加,而世界知识任务则有所退步。双语词典归纳将法语嵌入与 GPT-2 对齐,p@1 = 68.84 +/- 8.61%,比机会高出 18 倍,这表明跨语言对齐跟踪的是获得的语法能力而不是训练持续时间。消融研究表明,单标记零样本评分主要由儿童规模的标记器和模板工件主导,激发标记器交换敏感性、安慰剂控制的提示和母语最小对基准作为标准诊断。