论文

SemanticZip:使用 LLM 作为语义解压缩器的有损文本压缩试点框架

SemanticZip: A Pilot Framework for Lossy Text Compression with LLMs as Semantic Decompressors

上下文与知识上下文工程

摘要

大语言模型 (LLM) 系统的文本压缩通常被定义为标记删除、检索、摘要或精确重建。我们研究了一种更激进但明显有损的设置:将文本压缩为紧凑的代码,LLM 可以将其扩展为与任务相关的含义。我们将此设置称为 SemanticZip。与无损压缩不同,SemanticZip 不需要字节相同的重建;与普通摘要不同,它将基于模型的解压缩视为编解码器的一部分,并评估是否恢复了与任务相关的语义承诺。本文是一个试点框架,而不是基准声明。我们形式化了 LLM 介导的解压缩,定义了受保护/有损数据包架构,并评估了五个作者构建的诊断案例的六种表示机制:结构化散文、JSON、CCL-Core、CCL-Min、SemanticZip ASCII 和 SemanticZip emoji。独立解码器 LLM 从每个压缩表示中重建类型语义原子,并且我们对关键原子召回率、加权原子召回率、精度和分词器增益进行评分。在此试点中,结构化散文具有最高的可恢复性,WAR = 0.956 和 19.1% o200k_base 词元增益。 CCL-Min 是最强的平衡点,词元收益为 39.4%,WAR = 0.874。 SemanticZip ASCII 提供了最大的有用压缩,词元增益为 46.5%,WAR = 0.802,而表情符号较多的 SemanticZip 在压缩和恢复方面表现较差。主要贡献并不是声称这些数字建立了普遍边界。相反,我们引入了一个可重现的实验接口,用于研究有损、LLM 可解压缩的文本代码和设计原则:安全关键和精确的承诺应保持受到保护,而可预测的低风险上下文可以在语义上进行压缩。