论文

通过双流强化学习进行词元稀疏医学多模态推理

Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning

模型推理推理加速

摘要

结合强化学习 (RL) 的视觉语言模型 (VLM) 在多模态推理方面取得了显着进展,但仍难以处理医学图像,因为医学图像通常会表现出极其稀疏的视觉证据来为临床决策提供信息。我们认识到,修剪基础区域之外的视觉标记可以极大地增强医学推理。然而,用于主动视觉标记修剪(VTP)和医学多模态推理的统一强化学习框架尚未建立。在这里,我们提出了一个双流 RL 框架 ViToS,来实现词元修剪和问题回答。 ViToS 使用两个任务分支训练一个策略模型,其中一个专注于视觉定位,而另一个在 VTP 之后进行词元稀疏推理。此外,我们通过引入交叉反馈顺序优化来解决耦合策略学习问题,避免梯度冲突并促进共享策略模型的收敛。在七个医学基准上进行评估,我们的方法将视觉标记减少到原始序列长度的 77%,同时在 Lingshu-7B 上实现 108.27% 的相对性能,在 HuatuoGPT-Vision-7B 上实现 104.16% 的相对性能。总体而言,ViToS 提供了卓越的性能和推理速度,为医疗多模态推理建立了高效的范例。