论文
分析和改进医疗 LVLM 中的细粒度偏好优化
Analyzing and Improving Fine-grained Preference Optimization in Medical LVLMs
摘要
大视觉语言模型 (LVLM) 在医学成像任务中取得了出色的性能,但它们仍然容易出现事实不一致、视觉基础差以及与临床有意义的反馈不一致的情况。现有的 后训练 对齐方法,包括直接偏好优化(DPO)及其变体,在医学领域面临三个关键限制:(1)序列级奖励信号将临床关键标记与通用填充文本相同地对待; (2) 依赖静态监督的 微调 参考作为首选响应引入了 离策略 分布偏移,将优化转向风格伪影而不是临床正确性; (3)对齐目标缺乏明确的视觉基础约束,使得模型对微妙但具有诊断决定性的病理特征不敏感。我们的方法利用双向 token-wise KL 正则化器以及视觉对比基础目标,将干净的图像和病变损坏的图像配对,以惩罚在没有足够视觉证据的情况下生成的响应。这些组件共同形成了一个细粒度的 同策略 对齐框架,该框架通过最少地编辑模型生成的输出来构建偏好对,仅纠正临床上错误的跨度,同时保留原始语言风格。跨医学成像任务和临床文本生成基准的广泛实验验证了我们方法的有效性。