论文

通过工具监督的强化学习进行视觉推理

Visual Reasoning through Tool-supervised Reinforcement Learning

智能体系统Agent 工具调用

摘要

在本文中,我们研究了如何有效掌握工具使用来解决 Multimodal 大语言模型 的复杂视觉推理任务的问题。为了实现这一目标,我们提出了一种新颖的工具监督强化学习(ToolsRL)框架,通过直接工具监督来实现更有效的工具使用学习。我们专注于一系列简单、原生、可解释的视觉工具,包括放大、旋转、翻转、画点/线,其工具监督易于收集。开发了强化学习课程,其中第一阶段仅通过一组动机良好的特定工具奖励进行优化,第二阶段使用精确度目标奖励进行训练,同时允许调用工具。这样,在使用工具完成视觉推理任务之前就掌握了工具调用能力,避免了异构任务之间潜在的优化冲突。我们的实验表明,工具监督的课程训练是高效的,ToolsRL 可以为复杂的视觉推理任务实现强大的工具使用能力。