论文
LLM推理的统一数据选择
Unified Data Selection for LLM Reasoning
摘要
有效训练 大语言模型 (LLM) 进行复杂、长 CoT 推理往往会因需要大量高质量推理数据而遇到瓶颈。现有方法要么计算成本昂贵,要么无法可靠地区分高质量和低质量的推理样本。为了解决这个问题,我们提出了高熵总和(HES),这是一种 无需训练 指标,通过仅对每个推理样本中最高(例如,0.5%)最高熵标记的熵求和来量化推理质量。我们在三种主流训练范例中验证 HES:监督 微调 (SFT)、拒绝 微调 (RFT) 和强化学习 (RL),大量结果证明了其一致的有效性并显着降低了计算开销。在 SFT 中,对 HES 排名前 20\% 的数据进行训练与完整数据集性能相匹配,而使用最低 HES 数据会降低其性能。在 RFT 中,我们基于 HES 的训练方法明显优于基线方法。在强化学习中,HES 选择的成功轨迹使模型能够学习强大的推理模式,显着优于其他比较方法。我们的研究结果将 HES 确立为一个强大的 无需训练 指标,它能够为在 LLM 中开发高级推理提供统一、有效且高效的方法。