论文

有损压缩文本自动编码器

Lossy Compressive Text Autoencoders

模型优化模型压缩蒸馏

摘要

我们的工作探索在数据压缩和表示学习的交叉点学习文本的压缩潜在表示。我们提出了一种自动编码器架构,它沿时间轴执行隐藏表示的残差缩小和放大,并具有残差低维离散瓶颈。我们分析了不同量化方法、训练目标和数据集的方法。对于不同级别的压缩,我们在表面级别(BLEU)和语义级别(基于 LLM 的判断)评估原始文本和重构文本之间的相似性。此外,我们还根据下游问答和语义文本相似性基准评估我们的模型。我们的方法产生的压缩表示与 Web 文本数据上每字节 2.24 位的无损文本压缩算法相当,同时具有良好的重建和下游任务性能。