论文

多式联运的多分支策略优化 大语言模型

Multi-Branch Policy Optimization for Multimodal Large Language Models

模型训练强化学习

摘要

用于多模态 大语言模型 的基于组的强化学习方法通​​常依赖于轨迹级信用分配,该分配将单一优势应用于响应中的所有标记。然而,多模态推理比纯文本设置涉及更高的感知不确定性,在纯文本设置中,模型必须反复重新检查视觉信息以验证中间解释,并且不同的视觉基础可能导致不同的推理路径,使得这种统一的信用分配特别不足,并导致相对优势逐渐退化为零。为了应对这些挑战,我们提出了多分支策略优化(MBPO),这是一种基于树的框架,在视觉语言决策边界构建推理树,使兄弟分支能够探索不同的视觉假设,并通过分支相对优势分配段级信用。我们进一步引入了一个时间重播缓冲区来重用信息片段,同时控制策略的陈旧性。对多个多模态推理基准的实验表明,MBPO 的性能优于代表性基线,提高了学习信号质量和优化效率。该代码可在 https://github.com/ShuaiLyu0110/MBPO 上公开获取。