论文

逻辑先于语言:形式推导的预训练促进技能习得和可压缩性

Logic Before Language: Pre-pretraining on Formal Derivations Fosters Skill Acquisition and Compressibility

模型训练预训练

摘要

对符号数据进行预训练语言模型 (LM) 可以加速和改进自然语言习得。然而,现有的预训练任务,例如 Dyck 和过程算法,依赖于狭窄的原语,无法捕捉自然语言的表达能力。此外,先前的研究仍然仅限于相对较小的 词元预算,对技能出现和表征动态的洞察有限。为了解决这些限制,我们提出逻辑预训练(Logic-PPT)作为一种有原则的初始化策略,利用形式推导来传递更丰富的结构和语言偏差。形式推导需要以自然语言为核心的抽象机制,同时绑定变量、连接量词和关系依赖,以及在长上下文中组成谓词-论证结构。将我们的评估扩展到 100B 个词元体系,逻辑预预训练大大加速了 LM 中的技能获取,在语言任务上实现了 80% 的准确率,并且比标准初始化少了 36B 个词元,并且性能优于替代的预训练基线。从机制上讲,形式推导会引起持续的结构重组,其明显特征是低阶、光谱集中的表示空间。至关重要的是,我们表明,这种内部几何结构可以通过修剪来提高模型的可压缩性,即使在稀疏度为 $\approx$33\% 的情况下,也能匹配密集的基线性能。