论文

推理监督的哪些属性与下游模型质量的提升相关?

What properties of reasoning supervision are associated with improved downstream model quality?

模型评测评测方法与指标

摘要

为推理模型验证训练数据通常需要代价高昂的试错式微调循环。在这项工作中,我们研究能否利用数据的内在指标在训练之前可靠地预测一个推理数据集的效用。我们提出一套量化度量,并通过在一个波兰语推理数据集的语义不同变体上微调8B和11B模型来评估其预测能力。我们的分析显示,这些内在指标与下游模型性能表现出强且显著的相关性。关键的是,我们发现效用的预测因子依赖于规模:较小的模型依赖关注对齐的指标来保证精确性,而较大的模型受益于高冗余,利用冗长的轨迹来解决复杂任务。这些发现建立了一个规模感知的推理数据验证框架,使从业者无需穷尽的实证测试即可选出有效的训练集。