论文

DiffuMask:词元级 提示修剪的扩散语言模型

DiffuMask: Diffusion Language Model for Token-level Prompt Pruning

上下文与知识上下文工程

摘要

情境学习和思维链促进 大语言模型 (LLM) 中的推理能力提高。这些通常的代价是更长、更昂贵的提示,并且可能包含冗余信息。基于修剪的即时压缩提供了一种实用的解决方案,但现有方法依赖于计算密集型的顺序标记删除。我们提出了 DiffuMask,一种基于扩散的框架,集成了分层射击级和 词元级 修剪信号,可通过迭代掩模预测实现快速并行的即时修剪。 DiffuMask 通过在每个去噪步骤中屏蔽多个标记,显着加速了压缩过程。它提供对保留内容的可调控制,保留必要的推理上下文,并实现高达 80% 的提示长度减少。同时,它保持或提高了域内、域外和跨模型设置的准确性。我们的结果表明,DiffuMask 为即时压缩提供了一个可泛化且可控的框架,有助于在 LLM 中进行更快、更可靠的上下文推理。