论文

SD-GRPO:用于长形式视觉语言生成的可验证片段分解

SD-GRPO: Verifiable Segment Decomposition for Long-Form Vision-Language Generation

模型训练强化学习

摘要

组相对策略优化 (GRPO) 及其变体最初是为 大语言模型 (LLM) 开发的,最近已应用于多模式 LLM 并产生了良好的结果。然而,它们从单一标量优势中进行的粗粒度整体贡献分配不适合视觉语言(VL)任务,其中输出通常是基于语义丰富的图像的长格式响应。为了解决这个限制,我们利用了单标量公式丢弃的结构化信号:长格式 VL 输出的自然分割。具体来说,我们提出了分段分解 GRPO (SD-GRPO),它将整个采样轨迹组中可验证的每分段奖励进行 z 标准化,产生每分段优势的向量来代替单个标量。我们在三个设置中评估 SD-GRPO,涵盖受控和现实世界的长格式 VL 生成,通过增加跨段的语义纠缠来组织。在由 DOCCI 构建的受控多面板详细图像描述任务中,其中分段在语义上是独立的,SD-GRPO 始终优于 GRPO 基线,在分段计数越高时增益越大。扩展到由 MultiChartQA 构建的受控多图表长格式 VQA 任务,我们从理论和经验上证明,执行轨迹级奖励会受到跨部门信用误分配的影响,该误分配会随着输出长度的变化而变化。在 MMSci 数据集上的现实世界科学图形字幕任务中,子图字幕共享整个图形的上下文,混合整体奖励和每段奖励可以进一步改善两者,这表明当段在语义上纠缠时,单独每段标准化是不够的。最后,通过将 SD-GRPO 集成到 Dr. GRPO 中,我们确认它可以以最小的实现开销应用于任何 GRPO 框架,以增强长格式 VL 的生成。