论文
从通才到专才:使用冻结VLM的内镜息肉报告上下文融合框架
From Generalist to Specialist: A Context-Fusion Framework for Endoscopic Polyp Reporting with a Frozen VLM
摘要
可靠的内镜息肉报告需要在单一记录内整合定量病灶尺寸、标准化巴黎分类以及有临床意义的形态学描述。通用视觉-语言模型(VLM)为图像理解与报告生成提供了统一接口,但现有的专用化策略通常依赖任务专用模型或模型权重适配,尚未解决如何在保留统一接口与VLM预训练能力的同时引入可靠的专科知识。我们提出一个上下文融合框架,通过隐式指令上下文与显式转导上下文使冻结的通用VLM专用化,而不修改其预训练权重。具体而言,一个自监督息肉编码器检索相关的图像-报告对作为显式的、查询特定的证据,同时学习到的连续专科token提供跨病例共享的隐式指令上下文。实验在2,056张专家标注的公开内镜图像上进行,我们将该框架与通用VLM、任务专用预测器以及权重适配方法比较,以评估专科性能、统一报告与适配效率。在数值、分类与报告生成指标上,所提框架大幅优于直接冻结VLM推理,并在所评估方法中取得最强综合表现。其新增可训练参数仅相当于冻结VLM参数量的0.006%。当top-1检索病例携带正确目标类别时,该框架纠正了权重适配基线所犯错误的70.5%。这些发现支持将上下文融合框架作为冻结VLM专科化的一种轻量有效策略。
