论文
扩散压缩:利用扩散 LM 进行无损压缩
Diffuse to Compress: Leveraging Diffusion LMs for Lossless Compression
摘要
我们研究无损文本压缩问题,其动机是数字文本数据(包括纯文本、源代码和 XML 等结构化格式)收集和存储的快速增长,以及基于神经语言模型的压缩的最新进展。特别是,最近基于 LLM 的方法,无论是构建在符号排名管道上还是与统计压缩器配合使用,都已证明其压缩率明显优于文本和代码上的通用压缩器(例如 zstd、gzip 或 bzip)。然而,这些神经方法受到严重的吞吐量限制,使得它们尚未实际使用。我们首次在无损神经文本压缩的背景下引入扩散语言模型(DLM)作为基于自回归 LLM 方法的替代推理范例。我们认为,在同一压缩框架内用 DLM 替换自回归 LLM 可以克服由每步一个符号限制引起的吞吐量瓶颈。然而,实现这些改进需要解决将 DLM 应用于无损压缩所带来的算法挑战,其中该架构允许独立决定每个前向传递中编码的符号的数量和位置。我们设计了高效且有效的策略来解决这些挑战,并在 enwik8(一个完善的文本基准)上针对基于 LLM 的通用压缩器对它们进行实验评估。我们的结果表明,新提出的基于 DLM 的框架推进了无损文本压缩的最新技术。此外,由于 DLM 仍然是一个相对年轻的范式,最近在能力越来越强、效率越来越高的模型方面取得的进展表明,进一步改进的空间很大。