论文

少即是多:边缘设备上问答应用程序的轻量级快速压缩

Less is More: Lightweight Prompt Compression for Question Answering Applications on Edge Devices

上下文与知识上下文工程

摘要

在代理驱动的问答 (QA) 应用程序中,通常引入检索增强生成 (RAG),通过提供额外的上下文来提高 大语言模型 (LLM) 的响应准确性。由于检索结果中固有的噪声和文档级检索的粗粒度,检索到的上下文通常包含大量冗余信息。在此设置中,由用户查询和关联的检索到的上下文组成的代理提示会在 LLM 推理期间导致不必要的计算开销。现有的提示压缩方法通常依赖辅助小语言模型(SLM)来估计上下文重要性。然而,此类方法会引入大量的内存和计算开销,这限制了它们在资源受限的边缘设备上的部署。在本文中,我们提出了 CORE,一种两阶段句子级提示压缩方法,无需 SLM。在第一阶段,CORE通过命名实体识别(NER)构建答案集,并通过语义匹配构建线索集。在第二阶段,CORE使用正交残差检索策略细化线索集,并设计基于空间邻近度的度量来过滤答案集。然后将这两个集合组合起来形成最终的压缩上下文。我们在 NVIDIA Jetson AGX Orin 边缘设备和华为 Nova 智能手机上实现了 CORE。实验结果表明,在 2000-词元预算 中,与最先进的基准相比,CORE 的准确率提高了至少 30.19%,同时内存使用量减少了至少 50.47%,在边缘设备上实现了至少 1.94 倍的加速。此外,与最先进的LLMLingua2方法相比,CORE在智能手机上实现了95.74%的大幅节能,凸显了其对于移动部署的实用性和通用性。