论文
从共识和分歧中学习:无监督 同策略 自 蒸馏 与少数群体轨迹对比
Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast
摘要
同策略 self-蒸馏 通过向教师询问学生实际访问过的状态来改进语言模型推理。最近的方法通过让教师接触特权环境来创造强大的信息不对称,但它们从根本上依赖外部监督(例如标准答案或验证者)来构建这种优势。我们引入了 CoDA(共识与分歧对齐),这是一个完全无监督的框架,它完全根据模型自身未标注的执行轨迹的潜在不确定性结构创建可靠的特权信息。 CoDA 提取两个互补信号。在正分支中,答案级共识确定了一种稳定的推理模式,这使得冻结的自学教师能够对新学生的轨迹提供密集的分布指导。然而,由于协议不能保证正确性,因此仅肯定的 蒸馏 存在将相关错误放大为错误共识的风险。为了打破这种有害的反馈循环,CoDA 引入了一个利用分歧的负面分支:少数轨迹被视为不稳定的替代方案,并通过参考锚定的 KTO 式校准目标进行温和的惩罚。这种不成对的二元反馈提供了强大的正则化,而不需要强假设共识是绝对的 真值。对竞赛级数学基准的实证评估表明,CoDA 显着提高了推理能力,超越了自行生成的基线,并有效稳定了训练以防止错误共识。