论文

条条大路通罗马:激励视觉语言模型中的发散思维

All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models

模型训练强化学习

摘要

最近的研究表明,强化学习(RL),特别是组相对策略优化(GRPO),可以本质上引发并增强视觉语言模型(VLM)的推理能力。然而,尽管有这样的希望,但驱动 RL 模型有效性的潜在机制及其局限性仍未得到充分探索。在本文中,我们强调了强化学习和基础模型之间的基本行为区别,前者从事更深层次但狭隘的推理,而基础模型尽管在个人路径上不太精致,但表现出更广泛和更多样化的思维模式。通过对训练动态的进一步分析,我们表明GRPO很容易出现多样性崩溃,导致模型过早地收敛到推理策略的有限子集,同时丢弃大多数潜在的替代方案,导致局部最优和可扩展性差。为了解决这个问题,我们提出了多组策略优化(MUPO),这是一种简单而有效的方法,旨在激励跨多个解决方案的发散思维,并在既定基准上证明其有效性。项目页面:https://xytian1008.github.io/MUPO/