论文

QwenVLConnector:快速、统一的医疗 VLM 聊天机器人,用于细粒度的临床感知和文本生成

QwenVLConnector: A Fast, Unified Medical VLM Chatbot for Fine-Grained Clinical Perception and Text Generation

模型架构新型架构

摘要

大多数医学视觉语言模型 (VLM) 擅长开放式报告生成和 VQA,但在统一界面内对结构化、细粒度的临床感知提供有限的支持。我们推出了 QwenVLConnector,这是一个基于 Qwen2.5-VL 的医疗聊天机器人,它在单个下一个词元目标下统一了分类、多标签分类、文本化检测、计数、回归和自由格式报告生成。我们的关键组件是一个轻量级密集的多层连接器,它聚合低级和高级视觉特征,通过预​​训练的视觉合并将它们对齐,并将它们与最终的视觉表示融合,而不增加序列长度。这种设计通过互补的空间和语义线索丰富了视觉标记,同时保持了效率。在 FLARE-2D 上,QwenVLConnector 将检测 F1 从 0.55 提高到 0.85,将单标签分类从 0.37 提高到 0.51,并将报告生成 GREEN 比 Qwen2.5-VL 基线提高多达 18.3 个点。我们进一步探索用于报告生成的多模式上下文学习,在不更新模型参数的情况下显示出额外的改进。总体而言,QwenVLConnector 提供了一个统一且高效的框架,将结构化医学感知与开放式临床文本生成相结合。我们的代码可以在此 https URL 中找到。