论文

论LLM推理数据选择中的步长混杂

On the Step Length Confounding in LLM Reasoning Data Selection

模型训练合成数据

摘要

最近,通过在大规模和高质量数据集上进行监督 微调,大型推理模型在需要长链思维推理的复杂任务上表现出了强大的性能。为了构建此类数据集,现有管道从功能更强大的 大语言模型 (LLM) 生成长推理数据,并应用手动启发式或基于自然性的选择方法来过滤高质量样本。尽管基于自然性的数据选择(通过 LLM 分配的平均对数概率对数据进行排序)的有效性已被证明,但我们的分析表明,当应用于 LLM 推理数据集时,它系统地更喜欢具有较长推理步骤(即每步更多标记)的样本,而不是更高质量的样本,我们将这种现象称为步长混杂。通过定量分析,我们将这种现象归因于推理步骤中低概率的第一个标记;较长的步长会削弱它们的影响,从而增大平均对数概率。为了解决这个问题,我们提出了两种变体方法:ASLEC-DROP,它在计算平均对数概率时丢弃第一个标记的概率;ASLEC-CASL,它应用因果去偏回归来消除第一个标记的混杂效应。四个 LLM 和五个评估基准的实验证明了我们的方法在减轻步长混杂问题方面的有效性。