论文
VisDoT:通过类人解读依据对齐与思维分解增强视觉推理
VisDoT : Enhancing Visual Reasoning through Human-Like Interpretation Grounding and Decomposition of Thought
摘要
大型视觉语言模型(LVLM)难以可靠地检测图表中的视觉基元并将其与语义表征对齐,这严重限制了它们在复杂视觉推理上的表现。这种感知接地的缺失构成了基于图表的推理的主要瓶颈。我们提出VisDoT,一个通过类人解读接地来增强视觉推理的框架。我们基于图形感知理论形式化了四个感知任务,包括位置和长度。在此基础上,我们引入思维分解(Decomposition-of-Thought,DoT)提示,将问题依次拆分为视觉感知子问题和逻辑子问题。用VisDoT微调InternVL在ChartQA上取得+11.2%的提升,并在更具挑战性的ChartQAPro基准上超越GPT-4o。在新提出的VisDoTQA基准上,该模型提升+33.2%。此外,在多样化开放域VQA基准上的一致零样本增益证实了感知—逻辑分离策略在视觉问答中的泛化性。VisDoT利用类人感知增强视觉接地,实现了最先进的图表理解和可解释的视觉推理。
