论文

SafeMed-R1:面向医疗大语言模型的临床医生审计式安全与伦理对齐

SafeMed-R1: Clinician-Audited Safety and Ethics Alignment for Medical Large Language Models

模型训练监督微调与指令调优

摘要

大语言模型(LLM)在执业资格考试上的表现日益比肩专家,但常规临床使用仍然有限,因为治理要求可审计的推理、安全与伦理对齐,以及对对抗性滥用的抵御能力。我们在此提出SafeMed-R1,它使用可追溯的临床信任信号(CTS)流水线进行训练,将每个推理实例与临床医生的量表评分和编辑历史相关联,并通过安全与伦理监督以及红队压力测试完成对齐。SafeMed-R1在临床基准上取得79.6%的宏平均准确率。在对抗性安全测试下,它表现出最低的总体风险,不安全输出相对其基线减少约3至5%。在一项针对30个用药安全案例的配对专家研究中,SafeMed-R1在医学正确性上与PGY1和PGY2住院医师相当,而在用药安全、指南一致性与临床有用性上得分更高。综合来看,这些结果表明,经临床医生审计的监督来源追溯,加上领域定制的安全与伦理对齐,能够加强治理相关证据,而无需依赖推理时检索或引文锚定。