论文

加权重要事项:通过词元重新加权提高医疗报告生成的样本效率

Weighting What Matters: Boosting Sample Efficiency in Medical Report Generation via Token Reweighting

模型训练监督微调与指令调优

摘要

用于生成医疗报告的视觉语言模型 (VLM) 的训练常常因缺乏高质量注释数据而受到阻碍。这项工作评估了使用加权损失函数来提高数据效率。与平等对待所有标记预测错误的标准交叉熵损失相比,重新加权损失将焦点转移到具有巨大临床重要性的语义显着标记上。在眼科报告生成的实验中,我们表明这种简单的方法可以提高多个数据规模的效率,以最多十倍的训练数据实现相似的报告质量。