论文

并非所有词元都同等重要:动态上下文向量 蒸馏 具有用于长格式医疗报告生成的决定性词元监督

Not All Tokens Matter Equally: Dynamic In-context Vector Distillation with Decisive-Token Supervision for Long-form Medical Report Generation

摘要

将演示效果提炼为隐藏空间干预措施,为全面微调提供了一种轻量级的替代方案。然而,现有的多模态变体主要是在简短的任务上进行评估,其中输出在几个标记后结束。将这些方法扩展到长格式生成暴露了一个基本但未经充分审查的限制:词元级 蒸馏 隐式地将所有输出标记视为同等信息,但长格式输出以高频模板和语法标记为主,而实际决定输出质量的标记分布稀疏。在医疗报告生成(MRG)中,有两个决定性的标记脱颖而出:确定诊断内容的病理相关标记和确定终止的序列结束(EOS)事件。两者在均匀交叉熵下都没有受到足够的监督,而自回归解码由于偏离了教师强制的轨迹而进一步加剧了问题。我们提出了 DIVE,这是一个冻结主干 蒸馏 框架,它通过与这些故障相匹配的两种互补机制来解决长格式报告的生成问题。决定性词元监督通过增加病理相关词元和 EOS 事件的交叉熵贡献来恢复监督平衡,确保内容保真度和终止是在训练期间学习的,而不是在解码时强加的。状态条件动态控制用隐藏状态相关适配器取代固定开环残差,允许注入信号适应解码漂移。在具有两个医学 VLM 主干的 MIMIC-CXR 和 CheXpert Plus 上进行的实验表明,DIVE 在词汇和临床代理指标方面始终名列最强方法之一。我们的方法在所有数据集-主干设置中实现了最佳的 BLEU-4、ROUGE-L 和 RadGraph F1,同时在粗标签级 CheXbert F1 上保持竞争力。