论文
扩散中的即时压缩 大语言模型:在 LLaDA 上评估 LLMLingua-2
Prompt Compression in Diffusion Large Language Models: Evaluating LLMLingua-2 on LLaDA
摘要
即时压缩降低了 大语言模型 中的推理成本和上下文长度,但之前的评估主要集中在自回归架构上。本研究检验 LLMLingua-2 是否有效转移至扩散 大语言模型 (DLLM),特别是 LLaDA-8B-Instruct。我们使用每个数据集 250 个提示以大约 50% 的压缩率来评估 GSM8K、DUC2004 和 ShareGPT,涵盖数学推理、提示重建和总结。使用精确匹配精度、BLEU、ROUGE 和 BERTScore 来比较原始提示、压缩提示和重构提示的输出。结果表明,高度语义保留并不一定能确保扩散模型中稳定的下游行为。概括仍然相对稳健,而尽管语义相似度很高,数学推理却大幅退化。重建进一步表明,语义相似的提示可能会忽略稳定去噪所需的推理关键信息。总体而言,压缩失败主要是由信息遗漏而不是语义漂移造成的,这表明自回归提示压缩方法可能无法统一转移到 DLLM。这些发现激发了扩散感知压缩策略。