论文

野外即时压缩:测量延迟、速率遵守和质量以实现更快的 LLM 推理

Prompt Compression in the Wild: Measuring Latency, Rate Adherence, and Quality for Faster LLM Inference

模型评测评测方法与指标

摘要

随着 IR 语言模型(特别是 RAG 系统)的广泛采用,底层 LLM 的延迟成为一个关键瓶颈,因为检索到的段落的长上下文会导致大量提示,从而导致计算量增加。提示压缩可减少输入提示的大小,同时旨在保持下游任务的性能,已成为加速 大语言模型 推理的经济有效且低延迟的方法。然而,它的有用性取决于生成期间的额外预处理时间是否可以通过更快的解码来抵消。我们对这种权衡进行了首次系统性、大规模的研究,在多个开源 LLM 和三个 GPU 类别中进行了数千次运行和 30,000 次查询。我们的评估将压缩开销与解码延迟分开,同时跟踪输出质量和内存使用情况。当提示长度、压缩比和硬件容量良好匹配时,LLMLingua 实现高达 18% 的端到端加速,并且在摘要、代码生成和问答任务中响应质量在统计上保持不变。然而,在此操作窗口之外,压缩步骤占主导地位并抵消了增益。我们还表明,有效的压缩可以减少内存使用量,足以将工作负载从数据中心 GPU 转移到商品卡,而延迟仅增加 0.3 秒。我们的开源分析器可以预测每个模型硬件设置的延迟收支平衡点,为即时压缩何时带来实际好处提供实用指导。