论文

保留文本的有损文本压缩:策略删除和LLM重建的研究

Text-Preserving Lossy Text Compression: A Study of Strategic Deletion and LLM Reconstruction

上下文与知识上下文工程

摘要

传统的无损文本压缩会保留每个字节,但在实际操作环境中,其对自然语言的增益通常不大。我们研究\emph{有损语义文本压缩},其中编码器策略性地删除部分文本,并且 大语言模型 (LLM) 从保留的骨架中重建原始内容。我们对一系列删除策略进行了基准测试,包括统一步骤删除、字长引导删除 (WordLen)、词频引导删除 (WordFreq)、LP 优化删除 (Opt)、使用 GPT-2 意外的基于熵的删除,以及结合频率和意外信号的混合方法。对 BBC 新闻数据集的保留率 $\r_{keep} \in [0.1,0.9]$ 的评估显示了三个主要发现。首先,WordFreq 是一个强大的低成本基线:尽管仅使用静态频率查找,但它与更昂贵的语义方法相比仍然具有竞争力,同时编码器速度更快。其次,语义和混合方法在轻度到中度压缩时提供了最明显的收益,而词频删除在最低保留率下通常更稳健。第三,QLoRA 微调 产生强大的本地解码器,可与 Gemini 2.0 Flash 竞争,并且在仅解码器比较中通常是最强的。其他英文和中文实验表明,整体框架跨域转移,而最佳删除规则仍然依赖于数据集。