论文

AIR:MLLM 中代码的自适应交错推理

AIR: Adaptive Interleaved Reasoning with Code in MLLMs

模型训练强化学习

摘要

继 OpenAI o3 发起的范式转变之后,通过代码进行交错推理以增强多模态 大语言模型 (MLLM) 已成为一个关键的研究前沿。现有文献主要关注视觉感知任务中的工具使用。然而,此类方法通常依赖于预定义的启发式进行视觉操作,并且由于其专门关注视觉操作,因此本质上无法解决数值计算问题。本文通过对代码增强的复杂数值计算任务进行扩展强化学习训练,使 MLLM 具有自适应交错推理能力。为此,我们提出了一个全面的三部分解决方案,包括:两阶段冷启动数据构建管道、用于 RL 数据集管理的数据过滤策略,以及利用用于交错推理轨迹的组约束奖励函数的自适应工具调用策略。大量实验表明,在使用群体约束奖励函数进行强化学习训练后,评估基准的性能平均提高了 6.1 个百分点 (pp)。其中,交错推理样本准确率提升9.9个百分点,工具使用整体成功率超过95%。我们的数据和代码位于:https://github.com/CongHan0808/AIR.git。