论文
TAPIOCA:为什么任务感知修剪可以提高 OOD 模型能力
TAPIOCA: Why Task- Aware Pruning Improves OOD model Capability
摘要
正如 TALE 所示,最近的工作促进了任务感知层剪枝作为提高特定任务模型性能的一种方法。在本文中,我们调查了这种改进何时发生以及原因。我们首先表明,在受控多项式回归任务和 大语言模型 中,这种修剪对分布内 (ID) 数据没有任何好处,但始终提高分布外 (OOD) 准确性。我们进一步凭经验表明,OOD 输入会导致分层范数和成对距离分布偏离相应的 ID 分布。这引出了任务感知修剪的几何解释:每个任务都会产生一个适应任务的几何形状,其特征是通过在 ID 输入上观察到的表示轮廓来经验表征的。 OOD 输入可能会引入适应任务的几何形状的扭曲版本。任务感知修剪识别产生或放大这种扭曲的层;通过删除它们,它将 OOD 表征规范和成对距离转向适应分布上观察到的值。这会将 OOD 输入与模型的任务适应几何结构重新对齐,并提高性能。我们通过受控分布变化和残差尺度干预提供因果证据,并证明跨模型尺度的一致行为。