论文
PACMS:子模块上下文选择作为 LLM 代理的可插入引擎
PACMS: Submodular Context Selection as a Pluggable Engine for LLM Agents
摘要
对话式和使用工具的 LLM 代理在一个上下文窗口上运行,该窗口同时从多个方向填充。随着会话的进行,代理会累积用户和助理的轮次、从持久内存存储中提取的条目,以及通常最大的工具调用的逐字输出,例如文件读取、搜索结果和 API 响应。一旦累积上下文超过模型的 词元预算,框架必须决定保留什么。普遍的机制是新近度截断,有时与定期总结相结合。这是主题盲的:在会话早期建立的事实仅仅因为它是旧的而被丢弃,即使当前用户查询正是关于该事实;相反,会保留冗长但不相关的最新材料。必须跨多个回合回忆信息的智能体(记忆的定义情况)正是新近度截断失败的地方。现有的替代方案位于代理的组装步骤之外。检索增强生成将外部文档提取到提示中,但不仲裁代理的 \emph{already-present} 池上下文。上下文压缩方法通过重写或修剪文本来减少标记计数,但操作是盲目且有损的。两者都不将内存条目、对话轮次和工具输出视为单个候选池,以便在组装提示时根据相关性从中进行选择。