论文
数据高效的语言建模:从前沿进展到原则引导的模型改进
Data-Efficient Language Modeling: From Frontier Advancement to Principle-Guided Model Improvement
摘要
从有限的文本中学习需要模型使用上下文、泛化到新的输入并保留有用的功能。求是引擎对 BabyLM 2026 Strict-Small 进行了长视野、端到端的自主研究计划,语料库词数在 1000 万个,累积词呈现量在 1 亿个以内。三个阶段连接前沿推进、原理发现和原理指导模型改进。第一阶段结合紧凑重述、预算再投资和剩余增量学习来构建前沿模型。第二阶段发现,根据目标关系和预测窗口,精确重复和对齐重述会产生不同的上下文使用模式。在受控任务中,恢复熟悉的性能并不能确保看不见的输入仍然可以使用学习的计算。这些发现支持可测试的数据高效学习原则:围绕预测所需的上下文依赖关系组织经验;单独设计可见信息、监管、保存;测试学习、概括和记忆。第三阶段保留源文本,掩盖更多本地线索,监督选定的目标,并保留对通常掩盖的输入的预测。来自同一父代的两个延续种子在完整的九度量聚合上优于普通延续。两代人的总体得分从 42.02 上升到 42.25;第二个在 2026 年 9 月 8 日公开的 Strict-Small 快照中取得了最高的总体成绩。进一步的研究涉及压缩、关系锚、共享表示和测量。模型可在 Hugging Face 上找到;代码和研究记录附在 GitHub 存储库中。这些阶段共同说明了研究 RSI:研究过程的递归自我改进。科学的认识和方法的创新改变了后续的问题和设计;新的实验测试并完善它们。