论文
通过体积计算机断层扫描分析的轨迹积分反馈调节解剖感知奖励
Regulating Anatomy-Aware Rewards via Trajectory-Integral Feedback for Volumetric Computed Tomography Analysis
摘要
医学视觉语言模型 (VLM) 作为通用多模式助手已迅速发展,但它们在 3D 计算机断层扫描 (CT) 分析中的部署仍然受到优化目标和临床严格性之间持续不匹配的限制。当前的强化学习(RL)范例仍然依赖于诱发“\textit{评估幻觉}”的词汇代理信号,其中模型优化语言流畅性而不是实际的临床正确性,从而导致诊断上的严重错误。为了弥补这一差距,我们引入了\textbf{临床异常基准底物(CABS)},这是一个将放射学报告分解为可验证的临床语义单元的结构化系统。使用 CABS,我们在标准强化学习中识别出“\textit{机械分歧}”,其中表面相似性奖励驱动策略梯度绕过医学事实。因此,我们提出 \textbf{轨迹积分反馈 GRPO (TIF-GRPO)},这是一种将控制理论原理集成到策略优化中的新颖框架。通过将临床推理制定为异常发现的伪时间轨迹,TIF-GRPO 通过积分反馈回路来调节解剖感知奖励,该反馈回路将持续遗漏作为累积状态错误进行惩罚,并将幻觉作为过度控制努力进行抑制。 3D CT 基准实验表明,我们的方法显着增强了异常检测和临床 忠实性,为医疗 VLM 的细粒度监管建立了新的范例。我们的项目位于 \href{https://github.com/ZJU4HealthCare/TIF-GRPO}{GitHub}。