论文

重新思考 LVLM 中的强化 微调:收敛、奖励分解和泛化

Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization

模型训练强化学习

摘要

具有可验证奖励 (RLVR) 的强化 微调 已成为为大型视觉语言模型 (LVLM) 配备工具使用和多步推理等代理功能的强大范例。尽管在实证上取得了显着的成功,尤其是视觉代理强化 微调 (Visual-ARFT),但这种范式的理论基础仍然知之甚少。特别是,两个关键问题缺乏严格的答案:(i)~可验证奖励的复合结构(格式合规性、答案准确性、工具可执行性)如何影响组相对策略优化(GRPO)的收敛,以及(ii)~为什么对一小组工具增强任务的训练转移到分布外域?我们通过引入\emph{工具增强马尔可夫决策过程}(TA-MDP)来解决这些差距,这是一个通过有限深度工具调用对多模式代理决策进行建模的正式框架。在此框架内,我们建立了三个主要成果。首先,我们证明复合可验证奖励下的 GRPO 以 $O(1/\sqrt{T})$ 速率收敛到一阶平稳点,并且明确依赖于奖励成分的数量和组大小(\textbf{Theorem~1})。其次,我们推导出一个 \emph{奖励分解定理},它限制了分解的每个组件优化和联合优化之间的次优差距,提供了奖励分解何时有益的精确表征(\textbf{定理~2})。第三,我们为工具增强策略建立了 PAC-Bayes 泛化界限,解释了 Visual-ARFT 中观察到的强分布外转移(\textbf{Theorem~3})。