论文

共识作为无标签自我的特权上下文 蒸馏

Consensus as Privileged Context for Label-Free Self-Distillation

摘要

对多个解决方案进行采样并返回多数答案是提高 大语言模型 无标签推理准确性的最可靠方法之一,并且越来越多的方法将这种共识信号转换为训练监督。然而,现有方法仅以有限的形式使用共识:作为为 微调 选择解决方案的过滤器,作为答案之间的偏好,或作为强化学习的标量奖励,丢弃达成一致的解决方案包含的大部分信息。我们提出 CANON(Consensus-ANchored self-蒸馏),这是一种无标签训练方法,可将共识转化为密集的 词元级 监督。对于每个未标记的提示,CANON 对多个解决方案进行采样,提取大多数答案,并在达到它的解决方案上条件化模型的冻结快照;然后,这位以共识为基础的老师会监督模型在每个词元上的采样轨迹。数学和科学推理基准实验表明,CANON 将 pass@1 提高了多达 12 个点,在七分之一的计算量上比无标签强化学习高出 6 个点,接近以标准参考解答为条件的教师;它使用汇总的未标记数据进行训练,然后转移到保留的基准,匹配使用标准标签的训练方法。分析表明,这些改进并不是纯粹的分布锐化:经过训练,该模型解决了以前在 32 次尝试中从未解决过的问题,并且其多数投票本身变得更加准确。