论文

智能家居的修剪会破坏什么以及何时破坏?评估跨架构和任务复杂性的 LLM 退化

What Breaks Under Pruning in Smart Homes, and When? Evaluating LLM Degradation Across Architectures and Task Complexity

模型评测鲁棒性、公平性与可信度评测

摘要

剪枝可以降低大型语言模型 (LLM) 的部署成本,但其对基于上下文的工具调用的影响仍然知之甚少。我们系统地研究了智能家居工具调用中剪枝引起的退化,涉及四个大语言模型,涵盖密集Transformer、密集混合和专家混合 (MoE) 架构,以及深度、宽度、混合和专家剪枝方法。经过后剪枝监督微调 (SFT) 后,我们评估了三个智能家居数据集中的 19,500 多个实例。除了总体任务准确性之外,我们还沿着两个维度来描述退化:动作组件(即操作、设备、参数和值)和任务复杂性。我们的结果表明,密集模型的安全剪枝区域很窄,随后会急剧退化,而 MoE 模型则可以容忍更多的剪枝。在模式级意图之前,修剪会降低基础特异性,而激进的密集修剪可能会导致系统性的过度拒绝。这些发现强调了在选择修剪的大语言模型以实现可靠的工具执行时,评估修剪超出总体准确性的重要性。