论文
长视野 LLM 推理的上下文回收
Context Recycling for Long-Horizon LLM Inference
摘要
大语言模型 (LLM) 在短上下文推理中表现出强大的能力,但由于上下文窗口限制和低效的词元使用,在长会话范围内性能会下降。我们介绍了 ContextForge,这是一个上下文回收系统,通过结合结构化查询生成、外部存储器检索和受控合成来跨轮维护任务相关信息。该系统可以高效地重用先前的计算,而无需依赖完整的上下文重放,从而减少词元开销,同时保持答案质量。我们使用 15 轮对话基准来评估 ContextForge,该基准测试跨结构化医疗保健查询的多轮推理、反向引用和域转换。与使用相同底层模型的基准代理相比,ContextForge 展示了更高的一致性并减少了词元消耗,同时保持了可比较的响应准确性。这些结果表明,上下文回收提供了一种实用方法,可以在长期任务中扩展 LLM 功能,而无需更大的上下文窗口或模型重新训练。代码和评估工件可在 https://github.com/Betanu701/ContextForge 上获取。