论文

LLM 后训练 中通过流形覆盖和稀疏特征覆盖进行分层数据选择

Hierarchical Data Selection via Manifold Coverage and Sparse Feature Coverage in LLM Post-training

模型训练合成数据

摘要

随着受监督的 微调 数据不断扩展,从大型候选池中选择高价值子集对于降低训练成本和提高模型性能至关重要。现有的方法通常直接在原始嵌入空间中测量多样性,其中几何度量纠缠着主导语义方向、细粒度监督差异和局部噪声。我们通过将数据选择表示为从粗到细的分层覆盖问题来解决这一限制,并提出 MASS。 MASS 使用密集自动编码器学习低维主流形坐标以进行粗略语义分组,然后使用 TopK 稀疏自动编码器在每个组内执行质量感知的稀疏特征覆盖。 Vision Flan 和 LLaVA-CoT 上的实验表明,MASS 在多个预算中始终优于强大的数据选择基线,并且在某些设置中仅使用一小部分数据就匹配或超过了完整的数据训练。