论文
小型 MLA-SSM 混合语言模型的探索性消融
An Exploratory Ablation of a Small MLA--SSM Hybrid Language Model
摘要
我们报告了 TALH(自适应潜在混合)的探索性单种子消融,TALH 是一种仅解码器的语言模型,具有并行多头潜在注意(MLA)和自定义循环状态空间(SSM)分支。五个变体,每个词元涵盖 117--217M 估计的活动参数,在 FineWeb 样本上从头开始训练,具有相同数量的优化步骤和词元。在此特定设置中,删除 SSM 分支会最大程度地降低验证困惑度(仅 MLA PPL 315),而删除 MLA 的影响要小得多(仅 SSM PPL 239)。密集 FFN 混合获得 PPL 231,而测试的 top-2 三元-MoE 混合获得 PPL 240,同时使用的峰值训练内存少 3.87 GB。我们还保留了初步的 Apple M3 时序观察:在五个未优化的实现中,仅 MLA 具有从 512 到 2,048 个提示词元的最平坦的测量到第一个词元的时间曲线,尽管密集的 Transformer 从绝对值来看要快得多。由于运行是单种子的,参数计数不匹配,评估流可能与训练源重叠,并且原始重复计时记录不可用,因此这些结果支持特定于实现的假设,而不是关于 MLA、SSM 或专家混合模型的一般结论。