论文
用于生成放射学报告的校准置信度表达式
Calibrated Confidence Expression for Radiology Report Generation
摘要
在放射学报告生成中安全部署大型视觉语言模型 (LVLM) 不仅需要准确的预测,还需要临床可解释的指标,以表明何时应彻底审查输出,从而使放射科医生能够进行选择性验证并降低影响临床决策的幻觉结果的风险。一种直观的方法是用语言表达置信度,即模型明确说明其确定性。然而,当前最先进的语言模型往往过于自信,并且在放射学报告生成等多模式环境中进行校准的研究也很有限。为了解决这一差距,我们引入了 ConRad(放射学报告置信度校准),这是一种用于 微调 医疗 LVLM 的强化学习框架,可在放射学报告的同时生成经过校准的语言化置信度估计。我们研究两种设置:单个报告级置信度得分和为每个声明分配置信度的句子级变体。两者均使用 GRPO 算法进行训练,奖励函数基于对数评分规则,通过惩罚错误校准来激励真实的自我评估,并保证奖励最大化下的最佳校准。在实验上,ConRad 显着改进了校准并优于竞争方法。在临床评估中,我们表明 ConRad 的报告水平分数与临床医生的判断非常一致。通过突出显示完整报告或低置信度声明进行有针对性的审查,ConRad 可以支持更安全地临床整合人工智能辅助报告生成。