论文

Dango:用于研究第二语言习得的严格 L1 大语言模型

Dango: A Strictly L1-Only Large Language Model for Studying Second Language Acquisition

模型训练预训练

摘要

我们推出 Dango,这是一个 1.8B 参数 大语言模型,专为第二语言习得 (SLA) 中 L1 到 L2(日语到英语)迁移的对照研究而设计。虽然之前的研究已经在语言模型中探索了 SLA,但它们主要依赖于较小的或非解码器模型,这限制了它们生成开放式文本的能力,并降低了它们作为实用的 L2 模拟器的适用性。我们发现将模型扩展到这种规模时面临的一个关键挑战:用于 L1 习得的“单语”预训练语料库中的 L2 污染。为了解决这个问题,我们提出了一种过滤方法来减少过早接触英语,同时保留现实的、最小的接触。然后,我们在 LLM 生成的 L2 学习课程上微调模型,以模拟 L2 习得过程。我们的评估证实,Dango 开发了类似人类的 L2 生成模式,其性能优于未经过滤的和标准的多语言基线。我们发布模型、数据和代码,以促进可重复的计算 SLA 研究和面向学习者的应用程序。