论文
分层视觉代理:管理联合图像文本空间中的上下文以进行高级图表推理
Hierarchical Visual Agent: Managing Contexts in Joint Image-Text Space for Advanced Chart Reasoning
摘要
高级图表问答需要对小视觉元素的精确感知和跨多个子图的多步骤推理。虽然现有的 MLLM 擅长理解单个图,但它们经常难以跨多个子图进行多步骤推理。我们提出了 HierVA,一种用于图表推理的分层视觉代理框架,它在联合图像-文本空间中迭代地构建和更新工作上下文。高层管理人员生成计划并维护仅包含关键信息的紧凑上下文,而专门的工作人员则执行推理、收集证据并返回结果。特别是,代理使用放大工具来限制视觉上下文,从而维护单独的视觉和文本上下文。 CharXiv 推理子集的实验证明了相对于强大的多模态基线的一致改进,消融研究验证了分层架构、范围视觉上下文和蒸馏上下文有助于互补增益。