论文

面向AI智能体长上下文窗口控制的可寻址召回压缩

Addressable Recall Compaction for Long Context-Window Control in AI Agents

上下文与知识上下文工程

摘要

长时程LLM智能体会累积推理轨迹、动作与工具观测,最终可能超出模型固定的上下文窗口。现有压缩方法通过丢弃、摘要或检索早期信息来应对这一限制,但可能删掉任务关键细节或无法可靠地恢复它们。我们提出ARC(Addressable Recall Compaction,可寻址召回压缩),一种将归档存储与活动上下文呈现分离的上下文管理框架。ARC将工具观测存储在只追加、按ID寻址的日志中,并在需要压缩时用紧凑的引用替换较旧的观测。智能体随后可使用这些标识符请求已存储的内容,而无需重新执行相应工具,也不必仅依赖基于相似度的检索。我们在16k上下文窗口的Qwen3-8B与32k上下文窗口的Qwen3-32B上评估ARC。在Needle-in-a-Haystack评估中,ARC取得平均精确答案准确率99.40%,而我们评估中表现最好的基线为88.12%。在我们的硬件成本模型下,ARC还降低了估计的服务时间与HBM流量。在LongBench-v2 Hard子集上,ARC取得平均准确率29.97%,表现最好的基线为28.25%。这些结果表明,在受测设置下,显式的、基于地址的召回相对于所评估的上下文管理基线能改善信息保持与服务效率。

面向AI智能体长上下文窗口控制的可寻址召回压缩:论文配图
图 2:我们的可寻址召回压缩工作流程。