论文

SAERL:用稀疏自编码器信号指导后训练数据组织

Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders

模型训练合成数据

摘要

模型内部编码了有关 大语言模型 (LLM) 如何处理其训练数据的丰富信息;然而,后训练 数据工程很大程度上依赖于外部信号,而忽略了模型内部丰富的内在信号。我们提出 SAERL,一种用于 LLM 强化学习(RL)的数据工程框架。它使用稀疏自动编码器 (SAE)(一种先进的机械解释工具)提取的模型内部结构,对三个内在数据属性进行建模:多样性、难度和质量。每个属性都基于具体的数据工程操作:具有用于批量多样性控制的适度批量混合的 SAE 空间聚类、用于从易到难的课程排序的难度代理以及用于数据过滤的质量探针。 SAERL 比普通 GRPO 平均准确率提高了 3.00%,在 Qwen2.5-Math-1.5B 上训练步骤减少 20%,达到了目标准确率,并且在模型规模和 RL 算法之间具有一致的增益。实验表明,SAE 可以有效地跨模型系列和规模迁移,作为一种轻量级且可重用的数据工程工具。这些结果表明,模型内部结构是 后训练 数据工程的强大且实用的信号源。