论文
超越静态视觉标记:结构化顺序视觉思维链推理
Beyond Static Visual Tokens: Structured Sequential Visual Chain-of-Thought Reasoning
摘要
当前的多模态 LLM 将图像编码为静态视觉前缀,并依赖基于文本的推理,缺乏目标驱动和自适应视觉访问。受人类视觉感知的启发——注意力有选择地、顺序地从信息最丰富的区域转移到次要线索——我们提出了结构顺序视觉 CoT SSV-CoT。首先,与问题相关的显着性图识别并组织关键视觉区域,明确地建模视觉重要性的空间分布。其次,推理是按照这种区分顺序进行的,从而引发了从主要线索到次要线索的类似课程的语义进展。该方法使用文本库和答案监督进行端到端训练,而不依赖于区域级注释或专门的外部工具。对各种视觉推理基准的实验显示出收益,验证了结构化和顺序视觉认知。