论文
阅读不等于推理:弥合视觉-文本压缩中的Agentic策略鸿沟
Reading is not Reasoning: Bridging the Agentic Policy Gap in Vision-Text Compression
摘要
多步语言模型智能体需反复处理不断增长的交互历史,带来可观的上下文成本。视觉-文本压缩通过把历史渲染为图像来降低这些成本,但由此产生的模态切换造成明显的能力鸿沟。通过对历史恢复、同状态决策与完整轨迹的受控评测,我们证明这一鸿沟无法仅用OCR质量解释。视觉历史智能体在动作选择、查询构造、停止时机与证据使用上表现出系统性漂移,揭示了一种agentic策略鸿沟(agentic policy gap)。我们提出CAPS,一个两阶段的跨模态Agentic策略自蒸馏(Cross-modal Agentic Policy Self-distillation)框架,用同一模型更强的文本历史策略监督其视觉历史对应策略。离线轨迹自蒸馏把成功的文本策略行为迁移到视觉历史输入;在线策略自蒸馏则在强化学习期间对视觉历史策略访问的状态提供密集监督。在SearchQA上,使用3B与7B骨干时,CAPS分别超过AgentOCR 5.0%与3.4%;在全历史ALFWorld上,相应增益为15.6%与14.5%。在各设定下,与匹配的文本历史策略相比,CAPS将平均内存上下文成本最多降低63.3%,峰值成本最多降低83.4%。这些结果表明,显式的跨模态策略自蒸馏能够在视觉-文本压缩下保留智能体能力。我们的代码将在后续版本公开发布。
