论文
深陷文本债:面向MLLM智能体的保留视觉证据的上下文剪枝
Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents
摘要
多模态大语言模型(MLLM)越来越多地被部署为多步智能体,显式推理支持任务分解与工具协调,但也积累了大量自生成文本。在长轨迹中,这些文本可能主导上下文并压制视觉证据,形成“文本债”。我们观察到,一旦任务相关的视觉证据被落实,推理就变得冗余;而当落实仍不确定时,过时的假设可能误导后续推理。因此,剪枝必须在保留视觉证据的同时移除冗余文本。我们提出SPARE,一个以Kullback–Leibler(KL)散度为引导、为多模态工具使用智能体剪枝累积推理的框架。SPARE使用一个紧凑的任务状态摘要作为特权诊断上下文。对每个候选片段,它在原始上下文与摘要条件化上下文下回放同一模型;来自在线策略自蒸馏(OPSD)的反向KL散度随后检验该摘要是否足以覆盖该片段而不干扰后续推理。我们进一步用监督微调(SFT)训练摘要器,使摘要更紧凑、覆盖更广、剪枝更激进。在多个多步视觉工具使用基准上,SPARE在剪枝方法中取得最高平均准确率,同时移除37.89–64.58%的推理token。这种有利的准确率-上下文权衡表明,削弱文本主导地位能恢复对视觉证据的依赖,并缓解对自生成语言的过度条件化。
