论文
B-GRTO:用于参考细分的引导组相关工具优化
B-GRTO: Bootstrapped Group Relative Tool Optimization for Referring Segmentation
摘要
分割是计算机视觉中的一项基本任务,支撑像素级场景理解,并作为从自主感知到医学图像分析等应用的基石。对于复杂的参考分割,最近的方法将大型视觉语言模型与分割解码器配对:前者分析图像和提示,而后者预测目标掩模。尽管强化学习改进了推理密集型视觉语言系统,但分段解码器等可训练工具通常是通过可微分的目标单独优化的,并且这些目标与强化学习的原则性整合仍未得到充分探索。因此,我们引入了组相对工具优化(GRTO),这是一种基于数学的框架,用于通过可微分的工具使用联合优化策略。 GRTO 重用组相对策略优化 (GRPO) 部署来优化辅助工具目标,让解码器梯度补充策略奖励。此外,我们推导了 Bootstrapped-GRTO (B-GRTO),这是一种 预训练 方法,可以廉价地引导工具,从而实现更快的收敛和卓越的性能。在三个具有挑战性的引用分割设置中,B-GRTO 比普通 GRPO 取得了实质性改进,匹配或超越了特定领域的最先进方法。这证明了将强化学习与可微辅助目标统一起来进行推理密集型分割的价值。