论文

S-GRPO:用于大型视觉语言模型的统一 后训练

S-GRPO: Unified Post-Training for Large Vision-Language Models

模型训练强化学习

摘要

当前用于适应大型视觉语言模型 (LVLM) 的 后训练 方法通常分为两种范式:监督 微调 (SFT) 和强化学习 (RL)。尽管很流行,但这两种方法在单独应用时都会效率低下。 SFT 迫使模型沿着单一专家轨迹生成,通常会由于分布变化而导致对一般多模态功能的灾难性遗忘。相反,强化学习探索多个生成的轨迹,但经常遇到优化崩溃——这是一种冷启动问题,其中未对齐的模型无法在稀疏奖励视觉任务中自发地采样任何域有效轨迹。在本文中,我们提出了监督组相对策略优化(S-GRPO),这是一个统一的 后训练 框架,它将模仿学习的指导集成到偏好优化的多轨迹探索中。 S-GRPO 专为直接生成视觉任务而定制,引入了条件 真值 轨迹注入 (CGI)。当二进制验证器在一组轨迹采样中检测到完全探索性失败时,CGI 会将经过验证的 真值 轨迹注入候选池中。通过为这个注入的锚分配确定性最大奖励,S-GRPO 在群体相对优势估计中强制执行正信号。该机制将监督学习目标重新表述为策略梯度的高优势组成部分,迫使模型在利用专家轨迹和探索新颖的视觉概念之间动态平衡。理论分析和实证结果表明,S-GRPO 完美地弥补了 SFT 和 RL 之间的差距,极大地加速了收敛,并实现了卓越的域适应,同时保留了基础模型的通用功能。