论文

SPECTRUM:循环自蒸馏中的近端谱调制

SPECTRUM: Proximal Spectral Modulation for Looped Self-Distillation

摘要

从自己的输出中学习的模型继承的不仅仅是它们的正确性:它继承了它产生的解决方案。我们制定了循环自蒸馏,这是一种用于代码生成的自进化框架,其中模型在固定的信息预算下重复生成并从其自己的原始输出中学习,而无需对生成的样本进行持续的外部评估或基于测试的选择。我们确定了一个相应的分离:正确性可以提高,而正确实现的广度却缩小了。我们引入了 SPECTRUM,它在每轮中从固定参考锚点重新估计丢失敏感的键/值几何形状,并将其转换为全秩近端频谱调制。所有生成的补全都会训练一个 学生模型,其后续推理不需要干预。经过五轮 MBPP 实验后,SPECTRUM 保留了初始模型 64 个样本正确 AST 丰富度的 89.9%,而 Vanilla 自蒸馏为 66.4%,子空间投影控制为 65.5%。在匹配正确的样本计数时,优势仍然存在。无需进一步的训练或重新校准,所得的 学生模型 在 HumanEval+ 和 APPS Intro 上也实现了比 Vanilla SD 更高的匹配正确丰富度,证明了多样性优势的转移。这些发现将正确解决方案保留作为递归自我改进(RSI)的补充目标,并表明生成时间干预可以改善后续学生保留的解决方案库。

SPECTRUM:循环自蒸馏中的近端谱调制:论文原图
图 1:每个 学生模型 都继承延续的分布。共享代码前缀允许不同的延续形式。示意性直方图描绘了重复 Vanilla SD 下的浓度和 Spectrum 下更广泛的保留。高度是概念性的;实验测量完整正确的程序,而不是显示的延续开始(图 3)。