大型语言模型的词汇提示压缩:免训练的确定性管道,具有跨 11 个任务类别的经验帕累托分析
Lexical Prompt Compression for Large Language Models: A Training-Free, Deterministic Pipeline with Empirical Pareto Analysis Across Eleven Task Categories
摘要
大型语言模型 (LLM) 的最新进展使得提示变得越来越庞大和复杂。思想链推理(Wei et al., 2022)和上下文学习(Brown et al., 2020)等技术经常将现实世界的提示推到数千个词元以上,从而增加了推理成本和延迟。 LLMLingua (Jiang et al., 2023) 和 Selective Context (Li et al., 2023) 等学习压缩方法实现了高压缩比,但需要辅助语言模型并且是非确定性的。我们提出一个补充问题:在输出质量显着下降之前,基于经典词汇 NLP 的免训练、完全确定性、仅 CPU 的管道可以推进多远?十一个可切换的词汇转换——停用词删除、填充短语删除、缩写和缩写替换、基于词性的修剪、词形还原、WordNet 驱动的同义词缩短和命名实体保留——被组装到一个可配置的管道中。对来自 6 个来源(Dolly-15k、LMSYS-Chat-1M、WildChat-1M、MMLU、GSM8K、HellaSwag)的 1,242 个纯英语提示对 15 种配置进行了评估,涵盖 11 个自动派生的任务类别,产生 18,630 个配对的 GPT-4o-mini 完成结果。使用 BLEU、ROUGE-1/2/L、BERTScore-F1 和 SentenceBERT 余弦相似度来测量输出保留。与原始提示输出相比,最激进的配置在 BERTScore-F1 为 0.876 时实现平均词元减少 40.3% (sigma = 9.2);仅停用词配置可实现 29.6% 的降低,为 0.913。压缩与保真度帕累托前沿按任务类别进行表征,并根据常识推理出激进压缩下的系统故障模式。所有代码、提示和每个单元格的结果均已发布,以确保可重复性。