论文

大语言模型 的自适应多分辨率程序知识压缩

Adaptive Multi-Resolution Procedural Knowledge Compression for Large Language Models

上下文与知识上下文工程

摘要

大语言模型 (LLM) 广泛用于通过自主工作流程处理复杂任务。最近,可重用的自然语言技能已成为将程序知识注入 LLM 应用程序的流行范例。由于流行技能经常被重复调用,因此将其全文放在每个上下文中都会显着增加预填充成本和延迟。虽然文本压缩技术有可能解决这个问题,但大多数现有方法都是为了压缩文档中的事实知识而不是程序知识而设计的,这使得它们不足以进行技能压缩。在本文中,我们认为有效的技能压缩方法应该:1)保留工作流和工具协议之间的逻辑依赖关系,2)为频繁更新的社区技能启用轻量级离线压缩,3)适应技能之间不同的复杂性。为了解决这个问题,我们提出了 SKIM(SKIll 压缩),这是一种用于程序技能的自适应多分辨率软词元压缩框架。根据每种技能的复杂程度,SKIM 创建不同数量的软词元,这不仅提高了 LLM 推理的效率,而且还保留了技能使用的有效性。实验表明,SKIM 将技能压缩到原始词元长度的 30% 到 60%,同时比现有压缩方法更好地保持任务性能。我们已在 https://github.com/bebr2/SKIM 发布了我们的代码。