论文

通过能力选择性子空间投影的自我策略 蒸馏

Self-Policy Distillation via Capability-Selective Subspace Projection

摘要

自 蒸馏 通过对自己的一代进行训练来引导 大语言模型 (LLM)。然而,现有的方法要么依赖外部信号来管理自生成的输出(例如,正确性过滤、执行反馈和奖励搜索),这对于性能最佳的前沿模型来说成本高昂且无法实现,要么完全跳过管理并在所有原始输出上进行训练,这种方法通常是特定于领域的且难以泛化。两者还都有一个更深层次的弱点,即自我生成的输出将与任务相关的能力与其他能力纠缠在一起,例如风格模式、格式工件和特定于模型的错误,从而稀释了旨在提高的特定能力的信号。在本文中,我们提出了自策略 蒸馏 (SPD),它无需任何外部信号即可实现可泛化、能力选择性。具体来说,SPD 从模型自身的正确性定义词元梯度中提取低秩能力子空间,在自生成过程中将键值 (KV) 激活投影到该子空间中,并使用标准的下一个词元预测损失对生成的原始输出进行微调。通过代码生成、数学推理和多项选择 QA 方面的广泛实验,我们表明,与最先进的无外部信号的自 蒸馏 方法相比,SPD 实现了高达 13% 的改进,比预训练基线提高了 16%。值得注意的是,SPD 表现出了卓越的泛化能力,在域外泛化设置下实现了 15% 的性能提升。