论文
动态参数化不是动态推理
Dynamic Parameterization Is Not Dynamic Inference
摘要
依赖于输入的控制器系数通常被视为动态推理或计算节省的证据。这种解释合并了三个属性:系数变化、冻结模型对如何将系数分配给输入的依赖性以及条件执行。我们关注第二个属性,并制定冻结控制器审计的一般原则。我们提供了一种具体的实现,即冻结控制器审核(FCA),它沿着不受干扰的轨迹缓存完整的系数张量,禁用控制器,并通过交叉输入重新分配、词元洗牌和从独立校准集估计的静态配置文件来重放冻结模型。由于系数在任何干预之前被缓存,因此在重放测量分配依赖性下,性能会发生变化,而无需重新计算扰动隐藏状态的控制器的反馈。在七个独立训练的 76M FeatureGate Transformer 和三个 504M 模型中,静态分层配置文件分别保留了 Correct-to-GlobalMean 性能差距的 98.70% 和 99.43%。层同一性解释了 87% 到 96% 的系数方差。尽管如此,FeatureGate 仍会执行每个 Transformer 块,并且其测量的推理速度比 Dense 慢 30.8%。在公共 MUDDPythia-1.4B 检查点上,交叉输入重新分配和词元洗牌分别使 NLL 增加 1.9067 和 2.9637。这些惩罚表明该模型强烈依赖于内容条件的跨层分配。 MUDDPythia 还执行每个 Transformer 块。结果表明,仅动态参数化并不能建立动态推理,而函数动力学也不能节省计算量。关于动态模型的声明应分别报告系数变化、冻结模型的函数依赖性和实际执行情况。