论文
从饱和数据中学习:LLM 训练的信号超出正确性
Learning from Saturated Data: Signals Beyond Correctness for LLM Training
摘要
大语言模型 (LLM) 不断增长的功能导致许多用于改进它们的基准和训练数据集饱和。受此启发,我们研究以完美的经验准确性解决的问题是否可以用于提高下游绩效。为此,我们用两个更细粒度的质量信号源替换二进制正确性:(1)成对 LLM 自我判断,其中模型评估其自身解的相对质量,以及(2)词元级 熵,其中 词元级 不确定性用作解质量的代理。我们将这些信号合并到多种训练算法中,并在 Qwen3-1.7B-Base 上对其进行评估。当专门训练简单的算术任务时,基于质量的信号比基本模型的性能提高了高达 18.6\%$,大大优于 SFT。然而,在 GSM8K 上,增益更为温和,并且很大程度上取决于信号质量。例如,自我判断与更强大的外部判断的一致性较差,甚至可能导致性能低于基本模型。总体而言,我们的结果表明,基于质量的训练可以从基础模型的饱和问题中提取有用的信号,但将此类信号应用于更复杂的任务需要仔细校准和进一步研究。