论文

SpikeOPD:自回归脉冲语言模型的稳定同策略蒸馏

SpikeOPD: Stable On-Policy Distillation for Autoregressive Spiking Language Models

摘要

尖峰神经网络(SNN)通过稀疏编码和事件驱动计算提供了一条实现节能语言建模的途径,但从头开始训练有能力的尖峰语言模型仍然很困难。一种实用的替代方案是通过知识蒸馏 (KD) 进行 ANN 到 SNN 的迁移,其中预训练的人工神经网络 (ANN) 教师监督 SNN 学生。现有的迁移方法基于固定的语料库前缀,而自回归推理则基于自生成的前缀,从而造成前缀源不匹配。它表现为输出策略与人工神经网络教师的不匹配,以及自我生成和匹配的语料库前缀之间的内部尖峰动态漂移。在策略蒸馏 (OPD) 提供了一种自然的方法,通过持续教师对自生成前缀的监督来缓解这两种表现。我们通过受控压力测试评估了仅教师的全 KL 变体 Vanilla OPD,并观察到它可能会遭受延迟推出反馈崩溃的影响。这一结果表明,仅靠保单覆盖并不能确保稳定的适应。受这些发现的启发,我们提出了 SpikeOPD,这是一种用于自回归 SNN 的稳定的策略蒸馏框架,它可以从自生成的前缀中学习,同时保持推出稳定性。它应用全 KL 教师校正来减少输出策略不匹配,而匹配前缀策略锚定则限制策略偏离相同前缀上的冻结参考 SNN。分层尖峰正则化进一步限制了策略适应过程中的发射率偏差。在三个模型尺度上,SpikeOPD 在 0.125B、0.35B 和 1.3B 上分别将相应 KD SNN 的平均准确度提高了 0.8、1.7 和 2.9 个点,同时保留了它们的稀疏计算配置文件。

SpikeOPD:自回归脉冲语言模型的稳定同策略蒸馏:论文配图
图1 256个提示的Paid-prefix输出政策诊断。(A) 从教师到SNN KL,关于自产(固体)和材料(碎)前缀。(B) 迅速的内部自我-公司差距。