论文

LLM并非你所需要的一切:面向文本与图像医疗分类的ML与基础模型系统评估

LLM is Not All You Need: A Systematic Evaluation of ML vs. Foundation Models for text and image based Medical Classification

模型评测模型能力评测

摘要

多模态视觉-语言模型(VLM)与大语言模型(LLM)的结合为医疗分类开辟了新的可能。本工作提供一个严格、统一的基准,使用覆盖文本与图像模态(二分类与多分类复杂度)的四个公开数据集,把传统机器学习(ML)与当代基于 transformer 的技术进行对比。我们为每个任务评估三类模型:经典 ML(LR、LightGBM、ResNet-50)、基于提示的 LLM/VLM(Gemini 2.5)与微调 PEFT 模型(LoRA 适配的 Gemma3 变体)。所有实验使用一致的数据划分与对齐的指标。根据我们的结果,传统机器学习(ML)模型树立了高标准,在多数医疗分类任务上持续取得最佳整体表现,在结构化文本数据集上尤为突出。形成鲜明对比的是,LoRA 微调的 Gemma 变体在所有文本与图像实验中始终表现最差,未能从所提供的极少量微调中泛化。然而,零样本 LLM/VLM 管线(Gemini 2.5)结果不一:它们在文本任务上表现不佳,但在多分类图像任务上展现出有竞争力的表现,与经典 ResNet-50 基线持平。这些结果表明,在许多医疗分类场景中,成熟的机器学习模型仍是最可靠的选择。实验提示基础模型并非普遍优越,参数高效微调(PEFT)的有效性高度依赖适配策略,本研究中极少量微调被证明有害。

LLM并非你所需要的一切:面向文本与图像医疗分类的ML与基础模型系统评估
图1:糖尿病预测因子的数值特征分布