论文

HRM-Text:超越扩展的高效预训练

HRM-Text: Efficient Pretraining Beyond Scaling

模型架构递归架构

摘要

大语言模型 当前的预训练范式依赖于大规模计算和互联网规模的原始文本,为基础研究造成了重大障碍。相比之下,生物系统通过多时间尺度的处理表现出高度的样本效率学习,例如额顶叶环路的功能组织。以此为灵感,我们引入了 HRM-Text,它用分层循环模型 (HRM) 取代了标准 Transformer,将计算解耦为缓慢发展的战略层和快速发展的执行层。为了稳定语言建模的这种深度递归,我们引入了 MagicNorm 和预热深度贡献分配。此外,我们没有使用标准的原始文本预训练,而是使用任务完成目标和 PrefixLM 掩码专门对指令响应对进行训练。作为有效预训练的实证存在证明,仅在 400 亿个唯一词元和 1,500 美元预算上从头开始训练的 1B 参数 HRM-Text 模型在 MMLU 上实现了 60.7%,在 ARC-C 上实现了 81.9%,在 DROP 上实现了 82.2%,在 GSM8K 上实现了 84.5%,在 MATH 上实现了 56.2%。尽管与标准基线相比,使用的训练词元大约减少了 100-900 倍,估计计算量减少了 96-432 倍,但 HRM-Text 的性能与 2-7B 参数开放模型相比具有竞争力。这些结果表明,共同设计架构和目标可以从根本上降低计算性能比,使更广泛的研究社区可以从头开始进行预训练。