论文
通过深度不平衡回归的强化学习将分布意识注入 MLLM
Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression
摘要
多模态 大语言模型 (MLLM) 在长尾目标分布下难以进行数值回归。 词元级 监督 微调 (SFT) 和逐点回归奖励偏向高密度区域的学习,导致回归均值行为和较差的尾部性能。我们认为缺乏跨样本关系监督是现有 MLLM 训练范例的一个关键限制。为了解决这个问题,我们提出了一种基于组相对策略优化的分布感知强化学习框架,该框架通过基于一致性相关系数的奖励引入了基于批量比较的监督,以在相关性、规模和平均值方面对齐预测分布和 真值 分布。该框架是即插即用的,无需进行架构修改。在一套统一的长尾回归基准上进行的实验表明,相对于 SFT 和现有的 MLLM 回归方法有持续的改进,尤其是在中样本和少样本情况下取得了显着的进步。