论文
当平均CE失效时:中位数CE能更好地追踪语言模型质量
When Mean CE Fails: Median CE Can Better Track Language Model Quality
摘要
平均交叉熵是语言模型的标准验证指标,但它可能无法在训练期间追踪模型质量。我们在两个常见场景中考察这一问题。其一,在Qwen2.5-1.5B的合成事实学习SFT中,我们发现平均CE在初始学习阶段之后大幅上升,而留出集事实回忆准确率仍接近峰值。其二,我们发现在TinyStories上的top-K蒸馏中,减小K改善中位数CE却恶化平均CE;Top-5学生模型获得最高的LLM评判分数,并在中位数CE上低于其教师模型,尽管其平均CE最差。在这两种情形中,中位数CE与任务表现的相关性都远高于平均CE。分析主体与尾部百分位CE在训练期间的变化可以发现,训练重塑了经验的每词元CE分布。在top-K蒸馏中,更小的K产生两端质量更多的分布,使中位数下降、均值上升。在Qwen SFT中,主体迅速饱和,而尾部在训练后半段延展。在两者中,任务评估指标看起来对主体比对尾部更敏感。实践上,我们建议在均值之外报告一小组百分位CE摘要,并将其间的一致性作为追踪分布重塑的工具,以及在模型选择中均值与中位数CE不一致时的低成本诊断手段。
