论文

效率前沿:LLM 上下文管理中成本性能优化的统一框架

The Efficiency Frontier: A Unified Framework for Cost-Performance Optimization in LLM Context Management

上下文与知识上下文工程

摘要

大语言模型 (LLM) 越来越依赖于长上下文处理,但扩展上下文窗口会带来大量的计算和财务成本。现有的上下文缩减方法(包括检索和内存压缩方法)通常使用性能和效率指标进行独立评估,从而限制了系统比较和部署感知决策。本文介绍了 Efficiency Frontier,它是 LLM 上下文管理中成本性能优化的统一框架。该框架将上下文策略选择建模为部署感知优化问题,通过摊余成本建模共同考虑任务性能、词元成本和预处理重用。与孤立比较方法的现有评估不同,所提出的框架可以实现面向决策的分析。它确定不同的上下文管理策略在不同的操作条件下何时变得更可取。 HotpotQA 的实验揭示了基于检索和基于预处理的策略之间不同的操作机制和转换边界。结果表明,部署感知优化在可比较的性能下将有效词元使用量减少了约 25%,从而实现了 大语言模型 系统的更经济高效的部署,而摊销内存压缩相对于更高性能设置中的全上下文提示,可将词元成本降低 50% 以上。总体而言,所提出的框架为跨企业、科学和公共部门应用程序评估和部署可扩展、高效和可持续的 LLM 系统提供了原则和实践基础。