论文

面向多模态推理的分段对齐策略优化

Segment-Aligned Policy Optimization for Multi-Modal Reasoning

模型训练强化学习

摘要

现有面向大语言模型的强化学习方法通常在单个token或整条响应序列的粒度上执行策略优化。然而,这类表述常常与推理过程自然的分步结构不一致,导致多模态推理任务中的贡献归因欠佳和训练不稳定。为弥合这一差距,我们提出分段对齐策略优化(SAPO),一种新颖的强化学习范式,它将连贯的推理步骤而非token或完整序列作为策略更新的基本单元。SAPO在推理分段上引入逐步马尔可夫决策过程抽象,并配套与推理边界语义对齐的分段级价值估计、优势计算和重要性采样机制。在代表性推理基准上的实验表明,SAPO持续优于token级和序列级策略优化方法,取得显著的准确率提升,同时表现出更好的训练稳定性和价值估计一致性。我们的工作强调了使强化学习更新与推理内在结构对齐的重要性,为复杂推理任务中更高效、具有语义依据的策略优化铺平了道路。代码和模型将被发布以保证完全可复现。

面向多模态推理的分段对齐策略优化:论文配图
图 1:长 CoT 强化学习中学分分配粒度的比较。 (a) 诸如 PPO 之类的令牌级方法将优势独立地分配给各个令牌,从而导致同一推理步骤中产生嘈杂且不一致的学习信号。 (b) GRPO 等序列级方法在整个轨迹上分配统一的信用,无法区分各个推理步骤的贡献。