论文

学习自适应推理路径以实现高效视觉推理

Learning Adaptive Reasoning Paths for Efficient Visual Reasoning

模型推理测试时计算扩展

摘要

视觉推理模型(VRM)最近通过将视觉感知与语言推理相结合,表现出了强大的跨模态推理能力。然而,他们经常会思考过度,为任何任务产生不必要的长推理链。我们将这个问题归因于视觉推理中的\textbf{推理路径冗余}:许多视觉问题不需要完整的推理过程。为了解决这个问题,我们提出了 \textbf{AVR},一种自适应视觉推理框架,它将视觉推理分解为三个认知功能:视觉感知、逻辑推理和答案应用。它还使模型能够动态选择三种响应格式:完整格式、仅感知格式和直接答案。 AVR 使用 FS-GRPO 进行训练,FS-GRPO 是组相对策略优化的改编版本,鼓励模型选择最有效的推理格式,同时保持正确性。对多个视觉语言基准的实验表明,AVR 将词元使用量减少了 50--90%,同时保持整体准确性,特别是在感知密集型任务中。这些结果表明,自适应视觉推理可以有效减轻 VRM 中的过度思考。代码和数据可在以下网址获取:https://github.com/RunRiotComeOn/AVR。