论文
感知到推理:将感知和推理解耦以实现细粒度视觉推理
Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning
摘要
对于视觉语言模型来说,细粒度的视觉推理仍然具有挑战性,特别是当小但关键的视觉线索隐藏在高分辨率图像中时。现有的方法依赖于重复裁剪或测试时视觉搜索来引入局部证据,但它们通常不会明确区分感知和推理。在本文中,我们提出了感知到推理(P2R),这是一个统一的框架,它将细粒度视觉推理制定为两个阶段的过程:模型首先将与问题相关的证据定位为感知器,然后根据带注释的图像和裁剪区域作为推理器回答问题。为了更好地使训练与这种解耦的公式保持一致,我们进一步引入了感知推理交替GRPO(PRA-GRPO),这是一种角色感知强化学习策略,仅使用最终答案监督在以感知为中心的更新和以推理为中心的更新之间交替。 P2R 建立在 Qwen3-VL-Instruct-2B/4B/8B 之上,持续提高跨模型规模的性能。特别是,P2R-4B 在 V-Star 上达到 93.2%,在 HR-Bench-4K 上达到 81.9%,在 HR-Bench-8K 上达到 80.5%,大大优于其相应的骨干网。进一步的实验表明,P2R 的好处不仅限于高分辨率基准,还扩展到更广泛的多模态推理任务。这些结果表明,将感知与推理明确解耦为细粒度视觉推理提供了有效的框架。