论文

通过激活聚合进行即时压缩

Prompt Compression via Activation Aggregation

上下文与知识上下文工程

摘要

大语言模型 过程在生成响应之前通过数十层传播激活来进行提示。我们问是否可以将指令提示中包含的任务相关信息压缩为单个激活向量并重新注入到模型中,替换原始的标记序列?我们证明,使用在中间层提取并注入到目标 LLM 的早期层的激活学习加权和是可以实现的。压缩向量保留了任务相关信息,相对于完全提示处理,精度下降了 $2\%$ 以下。除了其实际意义之外,包括减少固定指令提示的每个查询计算而不重新处理原始标记序列,我们的分析揭示了 LLM 激活空间中的结构:(i)中间层表示有意义地转移到早期层,表明信息编码方式具有一定程度的跨层兼容性; (ii) 单个激活向量编码可量化且可恢复的语义信息量; (iii) 激活的加权和是一个鲁棒的表示压缩器。