论文
基准成功、临床失败:当强化学习优化的是基准而非患者
Benchmark Success, Clinical Failure: When Reinforcement Learning Optimizes for Benchmarks, Not Patients
摘要
面向大语言模型(LLM)的强化学习(RL)最新进展改善了推理任务表现,但其在资源受限条件下于医学影像中的应用仍未被充分探索。我们提出ChexReason,一个通过R1式方法(先SFT后GRPO)训练的视觉语言模型,仅使用2,000个SFT样本、1,000个RL样本和一张A100 GPU。在CheXpert和NIH基准上的评估揭示了一个根本性张力:GRPO恢复了分布内性能(在CheXpert上提升23%,macro-F1 = 0.346),但降低了跨数据集可迁移性(在NIH上下降19%)。这与NV-Reason-CXR-3B等高资源模型的表现一致,提示问题源于RL范式而非规模。我们识别出一个泛化悖论:SFT检查点在优化之前独有地在NIH上有所提升,表明教师引导的推理捕获了更多与机构无关的特征。此外,跨模型比较显示,结构化推理脚手架对通用视觉语言模型有益,但对医学预训练模型收益甚微。因此,对于需要在不同人群间保持鲁棒性的临床部署,精选的监督微调可能优于激进的强化学习。