论文

LiteMedCoT-VL:医学视觉问答的参数高效适应

LiteMedCoT-VL: Parameter-Efficient Adaptation for Medical Visual Question Answering

摘要

大型和紧凑视觉语言模型(VLM)之间的推理差距限制了医疗人工智能在便携式临床设备上的部署。 2-4B 参数的紧凑型 VLM 可以在资源受限的硬件上运行,但缺乏可解释的临床决策支持所需的多步推理能力。现有的 知识蒸馏 方法在没有推理过程的情况下传输答案。医学视觉问答(VQA)作为这个问题的测试平台,因为它需要模型通过结构化推理链将视觉证据与临床知识整合起来。我们引入了 LiteMedCoT-VL,这是一种通过基于 LoRA 的 微调 在解释丰富的训练数据上将思想链推理从 235B 教师模型转移到 2B 学生模型的管道。默认情况下,所有推理均在没有图像说明的情况下进行,模拟医生直接解读医学图像而无需随附放射学报告的临床场景。在 PMC-VQA 基准上,LiteMedCoT-VL 的准确率达到 64.9%,比零样本 Qwen3-VL-4B 基准的 53.9% 提高了 11.0 个百分点,并且优于所有已发布的基准。该结果表明,具有推理 蒸馏 的 2B 模型可以匹配或超过具有两倍参数的模型。视觉基础分析表明该模型依赖于图像内容而不是利用文本先验。我们的代码可在 https://github.com/R4nzer/LiteMedCoT-VL 上公开获取。