论文
大语言模型中的语言习得设备
Language Acquisition Device in Large Language Models
摘要
大语言模型 (LLM) 的数据效率仍然远低于人类。人们提出对合成语言进行预训练(PPT)来缩小这一差距,之前的工作强调了高度表达的形式语言,例如 $k$-Shuffle Dyck。受语言习得装置 (LAD) 假说的启发,该假说认为先天约束预先将学习者的假设空间限制为类似自然语言的结构,我们提出了受 LAD 启发的 PPT:对 MP-STRUCT 进行预训练,MP-STRUCT 是一种形式语言,其字符串通过 MERGE、AGREE 和 MOVE 编码分层组合、基于特征的依赖关系和长距离位移。带有 MP-STRUCT 的简短 500 步 PPT 在词元效率方面与强大的形式语言基线相匹配,同时还赋予了对结构上不合理的语言(例如 REVERSE)的类似人类的抵抗力。分析简化变体,我们发现 MP-STRUCT CORE 的性能优于 $k$-Shuffle Dyck,尽管它无法在 C-RASP 中定义(Transformer 表达能力的正式限制),这挑战了先前的假设,即有效的 PPT 语言必须具有层次表达能力和电路理论可学习性。我们表明,减少依赖解析模糊性的功能性地标是一个关键驱动因素,这表明有效的 PPT 设计不仅取决于表达性,还取决于依赖解析的可访问性。