论文

PruneShift:评估结构化剪枝中决策可靠性的框架

PruneShift: A Framework for Evaluating Decision Reliability in Structured Pruning

模型评测评测方法与指标

摘要

结构化修剪使用代理目标,因为对每个可行掩码进行直接任务评估成本太高。大多数评估报告了广泛采样掩模的平均替代误差或排名相关性。这些总结并不直接测试代孕妈妈选择的面罩。我们引入了 PruneShift,一个评估框架,它将广泛的预测保真度、选择器输出附近的保真度以及所选剪枝决策的质量分开。我们首先证明斯皮尔曼和肯德尔协议可以接近一个,而标准化选择遗憾仍然是最大的。然后,我们根据均匀误差、选择器次优性、决策裕度、密度比和比较质量得出充分条件。该分析还产生了具有明确超额成本界限的有限池证书。四项研究测试了这一论点中的不同联系。外部教科书 QA 确认是异构的:20 个同时间隔中的 7 个有利于代理选择掩码,6 个有利于其固定比较器,7 个过零。在固定的自然问题池中,严格改进适用于四种设置之一。受控 QQP 实验支持所有 16 个预先指定端点中所提出的覆盖机制,尽管足够的界限是保守的。最后,一项针对 OPT-125M 的受限 OSSCAR 重建研究显示,75 个主要终点中的 68 个终点的局部保真度优于广泛保真度。独立固定掩码确认在 25 个端点中的 24 个中没有结论,并且有利于其中一个端点的比较器。这些结果表明了为什么预测拟合、决策可靠性和修剪方法质量需要单独的证据。