论文
为长时间运行的交互中的 大语言模型 (LLM) 开发自适应上下文压缩技术
Developing Adaptive Context Compression Techniques for Large Language Models (LLMs) in Long-Running Interactions
摘要
由于上下文长度、内存饱和和计算开销的增加,大语言模型 (LLM) 在长时间运行的交互过程中经常会遇到性能下降。本文提出了一种自适应上下文压缩框架,该框架集成了重要性感知内存选择、一致性敏感过滤和动态预算分配,以保留基本的对话信息,同时控制上下文增长。该方法在 LOCOMO、LOCCO 和 LongBench 基准上进行评估,以评估答案质量、检索准确性、连贯性保持和效率。实验结果表明,与现有的基于内存和压缩的方法相比,所提出的方法在会话稳定性和检索性能方面实现了一致的改进,同时减少了词元使用和推理延迟。这些发现表明,自适应上下文压缩在持久 LLM 交互中提供了长期记忆保存和计算效率之间的有效平衡