论文

从通才到专才:使用冻结VLM的内镜息肉报告上下文融合框架

From Generalist to Specialist: A Context-Fusion Framework for Endoscopic Polyp Reporting with a Frozen VLM

应用与实践上下文与知识上下文工程科学研究

摘要

可靠的内镜息肉报告需要在单一记录内整合定量病灶尺寸、标准化巴黎分类以及有临床意义的形态学描述。通用视觉-语言模型(VLM)为图像理解与报告生成提供了统一接口,但现有的专用化策略通常依赖任务专用模型或模型权重适配,尚未解决如何在保留统一接口与VLM预训练能力的同时引入可靠的专科知识。我们提出一个上下文融合框架,通过隐式指令上下文与显式转导上下文使冻结的通用VLM专用化,而不修改其预训练权重。具体而言,一个自监督息肉编码器检索相关的图像-报告对作为显式的、查询特定的证据,同时学习到的连续专科token提供跨病例共享的隐式指令上下文。实验在2,056张专家标注的公开内镜图像上进行,我们将该框架与通用VLM、任务专用预测器以及权重适配方法比较,以评估专科性能、统一报告与适配效率。在数值、分类与报告生成指标上,所提框架大幅优于直接冻结VLM推理,并在所评估方法中取得最强综合表现。其新增可训练参数仅相当于冻结VLM参数量的0.006%。当top-1检索病例携带正确目标类别时,该框架纠正了权重适配基线所犯错误的70.5%。这些发现支持将上下文融合框架作为冻结VLM专科化的一种轻量有效策略。

从通才到专才:使用冻结VLM的内镜息肉报告上下文融合框架:论文配图
图1:统一内镜息肉报告生成的工作流程与动机。(A) 传统的图像到报告生成将定量、分类和描述性发现嵌入自然临床语句之中。我们将相同的临床内容重组为结构化的多任务 JSON 报告:直径和 Paris 分型可直接评估,同时完整输出会被转换为固定的临床语句用于报告生成评估。(B) 直接提示通用 VLM 缺乏专科病例上下文,而彼此独立的任务专用模型则将报告分散在各个独立预测器中。(C) 所提出的框架围绕一个冻结的 VLM,将显式转导上下文与隐式指令上下文相结合,通过一个统一接口完成全部三项报告任务。