论文

通过 GRPO 的方差感知评分标准奖励改善 LLM 中以心脏为中心的医疗问答

Improving Heart-Focused Medical Question Answering in LLMs via Variance-Aware Rubric Rewards with GRPO

模型训练奖励建模与过程监督

摘要

大语言模型 (LLM) 在医疗保健应用中表现出了强大的前景。然而,由于数据隐私限制、推理成本以及边缘或设备上使用的适用性有限,在现实环境中部署通用模型仍然很困难。这些挑战推动了更小、更高效的模型的开发,这些模型需要强大的 后训练 策略来确保可靠的医学推理。在这项工作中,我们研究了 后训练 LLM 的组相对策略优化 (GRPO),以心脏为中心的医学问答,并使用源自 RaR-Medicine 的基于标题的监督。我们提出了一种方差感知奖励框架,通过用从标准级评估结果派生的连续分析奖励函数取代加权二元标准聚合和单一整体李克特式评分,扩展了评估标准的显式聚合和隐式聚合策略作为奖励。该公式为稀疏、多标准、难以自动验证的反馈提供了更丰富的优化信号,并实现了更稳定的同策略强化学习。在 HealthBench 的心脏相关子集上,相对于 Qwen3-14B 基本模型,我们最好的 GRPO 变体将准确度从 0.362 提高到 0.502,F1 从 0.532 提高到 0.668,同时与 GPT-OSS-120B 保持竞争力(0.508 准确度,0.674 F1)。我们的研究结果表明,精心设计的基于评分标准的奖励为改善 LLM 中以心脏为中心的医学问答提供了实用的策略,并有可能扩展到其他基于评分标准的任务。