论文
Uni-Synergy:通过合作强化学习桥接理解和生成个性化推理
Uni-Synergy: Bridging Understanding and Generation for Personalized Reasoning via Co-operative Reinforcement Learning
摘要
统一多模态模型 (UMM) 在一般任务中表现出色,但难以弥合个性化理解和生成之间的差距。先前的工作很大程度上依赖于通过监督的 微调 进行隐式 词元级 对齐,这无法完全捕获理解和创建之间的潜在协同作用。在这项工作中,我们提出了 Sync-R1,这是一种端到端强化学习框架,可在单个显式推理循环中联合优化个性化理解和生成。通过这个统一的反馈流程,Sync-R1 能够实现个性化理解来指导内容创建,而由此产生的生成质量则可以在集成奖励环境中相互完善理解。为了有效地协调这种双任务协同作用,我们引入了 Sync-GRPO,这是一种利用集成奖励系统的强化学习方法。此外,我们提出动态组缩放(DGS),它自适应地过滤低势轨迹以减少梯度方差并加速收敛。为了更好地反映现实世界的复杂性,我们引入了 UnifyBench++,具有更密集的文本描述和更丰富的用户上下文。实验结果表明,Sync-R1 实现了最先进的性能,展示了卓越的跨任务推理和强大的个性化功能,而无需复杂的冷启动程序。代码和 UnifyBench++ 数据集将在以下位置发布:https://github.com/arctanxarc/UniCTokens。