论文

ClinAlign:从临床医生偏好扩展医疗对齐

ClinAlign: Scaling Healthcare Alignment from Clinician Preference

模型训练奖励建模与过程监督

摘要

尽管大语言模型(LLM)展示了专家级的医学知识,但将其开放式输出与细粒度的临床医生偏好保持一致仍然具有挑战性。现有的方法通常依赖于粗略的目标或不可靠的自动判断,这些判断缺乏专业指导。我们提出了一个两阶段框架来解决这一差距。首先,我们介绍 HealthRubrics,这是一个包含 7,034 个经医生验证的偏好示例的数据集,临床医生在其中完善了大语言模型起草的标准,以满足严格的医疗标准。其次,我们将这些准则提炼为 HealthPrinciples:119 个按临床维度组织的可广泛重复使用、基于临床的原则,从而实现超越手动注释的可扩展监督。我们使用 HealthPrinciples 来实现(1)通过合成未标记查询的量规进行离线对齐,以及(2)用于指导自我修订的推理时间工具。使用我们的框架训练的推理时仅激活 3B 参数的 30B 参数模型在 HealthBench-Hard 上达到了 33.4%,优于包括 Deepseek-R1 和 o3 在内的更大模型,为临床对齐建立了资源高效的基线。

ClinAlign:从临床医生偏好扩展医疗对齐
图2:方法概览。(上)HealthRubrics:我们使用GPT-5.1为真实世界的医学查询和多模型回答起草评分细则(rubric),随后由医生将其精炼为经过验证的偏好监督。(下)HealthPrinciples:我们将反复出现的rubric模式提炼为可复用、面向特定场景的原则,用于(i) 将基于rubric的监督扩展到新问题,以及(ii) 为推理时的自我修正提供rubric参考。