论文

深陷文本债:面向MLLM智能体的保留视觉证据的上下文剪枝

Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents

上下文与知识上下文工程

摘要

多模态大语言模型(MLLM)越来越多地被部署为多步智能体,显式推理支持任务分解与工具协调,但也积累了大量自生成文本。在长轨迹中,这些文本可能主导上下文并压制视觉证据,形成“文本债”。我们观察到,一旦任务相关的视觉证据被落实,推理就变得冗余;而当落实仍不确定时,过时的假设可能误导后续推理。因此,剪枝必须在保留视觉证据的同时移除冗余文本。我们提出SPARE,一个以Kullback–Leibler(KL)散度为引导、为多模态工具使用智能体剪枝累积推理的框架。SPARE使用一个紧凑的任务状态摘要作为特权诊断上下文。对每个候选片段,它在原始上下文与摘要条件化上下文下回放同一模型;来自在线策略自蒸馏(OPSD)的反向KL散度随后检验该摘要是否足以覆盖该片段而不干扰后续推理。我们进一步用监督微调(SFT)训练摘要器,使摘要更紧凑、覆盖更广、剪枝更激进。在多个多步视觉工具使用基准上,SPARE在剪枝方法中取得最高平均准确率,同时移除37.89–64.58%的推理token。这种有利的准确率-上下文权衡表明,削弱文本主导地位能恢复对视觉证据的依赖,并缓解对自生成语言的过度条件化。

深陷文本债:面向MLLM智能体的保留视觉证据的上下文剪枝:论文配图
图1:SPARE 概览。(a) 在完整推理轨迹中,累积的自生成文本强化过时假设并遮蔽工具返回的视觉证据,导致错误答案。(b) SPARE 调用一个紧凑的任务状态摘要作为瞬态探针,不写入持久轨迹。它在有/无摘要条件下分别重放每个历史推理片段,并用归一化反向 KL 度量其 token 级残余敏感度。基于计数的规则剪除摘要已覆盖但高 KL 残余不足的片段,同时保留证据关键片段。每个被剪除的片段由从其原始推理中提取的简洁结构化视觉证据替代,而以规划为主的文本被移除,原始工具调用、观察与图像保持不变。由此得到的上下文减少了文本债务,使后续推理重新聚焦于视觉证据,并产生正确答案。