论文
同策略蒸馏的统一逐Token门控:多通道与偏置系数的FKL/RKL混合
A Unified Per-Token Gating Family for On-Policy Distillation: FKL/RKL Mixing with Multi-Channel and Bias Coefficients
摘要
前向/反向 KL 损失的每个Token门控已成为同策略知识蒸馏(OPD)的标准技术,但现有方法如 EOPD(Jin 等人,2026)和 ToDi(Jung 等人,2025)均固定单个门控信号和单个门控方向,两者从未直接比较。我们引入了四系数参数化 lambda_t = sigma(a * h_t + b * u(x) + c + d * gap_t),其中 EOPD 和 ToDi 的方向对齐代理显示为一维 (1D) 限制,并添加了多通道组合和显式偏差作为进一步的自由度。在 TweetEval(Barbieri 等人,2020)情感和仇恨方面,在 Qwen3-32B 教师和 Qwen3-4B 学生的帮助下,整个系列中的配置达到了比 36 个可比细胞中的 33 个匹配幅度单通道(仅熵/仅间隙)一维限制更高的精度,并且 26 细胞均值匹配隔离实验将动态门控置于有效 KL 匹配静态基线之前26 个单元中的 19 个。由于细胞共享训练数据、模型和参数子结构,因此我们将这两种计数报告为探索性聚合方向证据,而不是独立的假设检验。此次扫描选出的九个标题比较的目标三种子配对复制(包括第三个任务,进攻性任务)在方向上是一致的,但单独小于单种子估计,并且在 n=3 时并不显着。因此,我们主要将参数化呈现为共享坐标系,用于比较短输出分类 OPD 中的每个Token门控设计。