论文
FOCUS & RePAIR:通过 词元级 修剪 大语言模型 指南减轻文本退化
FOCUS & RePAIR: Mitigating Text Degeneration via Token-Level Guidance for Pruned Large Language Models
摘要
修剪是压缩 大语言模型 (LLM) 的实用方法,但它会放大文本退化,尤其是重复循环,即使困惑度和任务准确性基本保持不变。在这项工作中,我们通过将解码视为进入并持续在一小组循环上下文中的动态过程,对这种故障模式进行了 词元级 分析。我们的分析将退化分解为循环进入风险和循环持久性,并表明持久性是由分配给词元采样集中合理替代方案的逃逸质量控制的。受这些发现的启发,我们提出了两个用于后剪枝 微调 的 词元级 指导目标。 FOCUS 将 蒸馏 重新赋予高置信度教师区域的权重以抑制泄漏,而 RePAIR 使用以起始为中心的正/负延续对和边际损失来促进合理的替代方案并防止过早承诺重复循环。开放式延续和基于指令的生成的实验表明,这两种方法一致地减少了重复并提高了生成质量。