论文

面向交互式放射科报告起草的离散扩散语言模型

Discrete Diffusion Language Models for Interactive Radiology Report Drafting

应用与实践内容创作

摘要

扩散语言模型经对token画布的双向去噪而非从左到右发射token生成文本——已具备与自回归(AR)生成竞争的实力。但医学基础模型几乎全部是自回归的。我们适配混合专家扩散语言模型DiffusionGemma-26B——并在医学视觉问答数据集上以相同LoRA配方对照其同尺寸AR兄弟Gemma-4-26B进行基准测试——由抗冗长LLM裁判评分。扩散模型在全部数据集上匹配或超越AR——微调后模型(3.8B激活)与前沿视觉语言模型具有竞争力——其解码还快3.5-4.4倍。超越这一对等性——扩散模型提供AR缺乏的起草能力:任意顺序填空。由于画布经双向去噪——放射科医生可以固定报告片段——让模型填充其间的文本——这是扩散固有而自回归不擅长的操作。这适合真实报告——它们在临床医生与机构之间往往简短或不一致。

面向交互式放射科报告起草的离散扩散语言模型:论文配图
图 1:医学 VQA 示例 (VQA-Med)。每个模特都会回答“CT 扫描有什么异常?” (参考:胰腺导管腺癌),LLM法官的判决(✓正确,×\次错误)。基础模型和前沿模型以完整句子回复,无论内容如何,​​精确匹配评分都会拒绝;这里只有经过微调的扩散模型才能正确回答。