论文

Func-R1:激励多模态大语言模型中的数学函数推理

Func-R1: Incentivizing Mathematical Function Reasoning in Multimodal Large Language Models

模型训练强化学习

摘要

在视觉环境中执行深思熟虑的数学推理是高级多模态大型语言模型 (MLLM) 的标志,并且需要感知基础和符号逻辑的复杂综合。然而,在数学函数领域,我们的研究揭示了一个关键的模态干扰现象:即使是先进的模型,在执行文本计算推理时,也往往会忽视或误解基本的视觉线索。为了应对这一挑战,我们提出了 Func-R1,它协同协调精确的视觉感知和严格的逻辑推理。具体来说,基于明确解耦的架构,我们采用分层后训练框架来逐步识别关键的视觉证据并进行深入的理论推理。此外,提出了感知对齐理论优化(PATO)策略,以引导策略更新内化基本理论属性,同时在整个推理过程中动态纠正异构视觉信息。跨不同基准的大量实验表明,Func-R1 在开源 MLLM 中提供了最佳性能,甚至超越了 GPT-5,在 MathVerse 面向函数的任务上提高了 8.4%。