论文

MM-ContextFold:用于多模式代理检索的上下文折叠

MM-ContextFold: Context Folding for Multimodal Agentic Retrieval

上下文与知识上下文工程

摘要

多模式代理检索(MAR)要求代理通过迭代调用外部工具来解决复杂的信息查找任务。 ReAct 等典型框架在单个、不断增长的上下文中维护原始多模式输入和累积的交互历史,从而导致上下文爆炸问题。虽然现有方法通过压缩冗余文本来缓解这个问题,但管理词元密集型视觉内容的有效策略在很大程度上仍未得到充分探索。为了解决这一差距,我们首先对大约 10,000 个轨迹进行了系统的实证研究。结果表明,随着通过外部工具逐步提取视觉线索并将其文本化到上下文中,原始图像变得越来越多余。持续的图像保留与较高的输出熵相关,甚至会降低任务的准确性。受这些发现的启发,我们提出了 MM-ContextFold,这是一种无需训练的框架,仅在需要时加载原始图像。它为高层规划维护一个持久的、纯文本的主上下文,并为依赖于图像的子任务生成临时分支上下文。在每个分支中,代理加载相关图像,完成子任务,并将结果作为简洁的文本摘要折叠回主上下文中;然后图像和分支跟踪被丢弃。对五个骨干模型的七个 MAR 基准进行的实验表明,MM-ContextFold 比 ReAct 平均准确率提高了 6.3 个百分点,同时工作上下文长度减少了 27.5%。