论文

语言模型推理的同行预测自我训练

Peer-Predictive Self-Training for Language Model Reasoning

模型训练监督微调与指令调优

摘要

在没有外部监督的情况下持续自我改进语言模型的机制仍然是一个公开的挑战。我们提出了同行预测自我训练(PST),这是一种无标签的 微调 框架,其中多个语言模型通过使用跨模型聚合响应作为内部训练信号来协作改进。给出提示后,模型会按顺序生成响应;最终的汇总答案通常比实践中的个人回答更可靠,可作为学习的内部参考。我们使用逐点互信息(PMI)来测量每个中间响应关于聚合的信息量,并使用该信号来扩展自我训练更新:已经与聚合对齐的响应接收较小的更新,而信息较少或未对齐的响应接收较大的更新。在数学推理基准测试(包括 SimulEq、MATH-500-Numeric 和 MultiArith)上,PST 将 Gemma-2-2B、LLaMA-3.2-1B 和 Qwen2.5-1.5B 的精确匹配精度提高了 2.2--4.3 个百分点,并将平均生成器-验证器间隙 (GV-Gap) 降低了 26--40%,同时无需外部监督,无教师-学生层次结构,并且只有跨模型交互。这些结果表明,来自跨模型代的同行预测反馈可以为自我监督的语言模型改进提供有效的机制。