面向生理安全临床语言模型的神经符号对齐
Neurosymbolic Alignment for Physiologically-Safe Clinical Language Models
摘要
临床LLM可能生成事实貌似合理但生理上不安全的建议。我们研究:能否通过将偏好优化建立在结构化生理知识而非纯文本监督之上来改进安全对齐。方法:我们提出Neurosymbolic Alignment,一个训练时框架,将一个7B临床LLM与构建于847K节点生物医学知识图谱之上的基于HGNN的生理世界模型相耦合。候选响应使用稳态约束、多跳路径合理性与药物相互作用惩罚进行评分,所得排序驱动迭代的on-policy ORPO更新。评估在临床安全基准(CSB)上进行,该基准包含2,500个场景,针对生成式临床推理中的生理约束违规。结果:相对ORPO,所提方法将CSS从69.5%提升至90.8%(+21.3个百分点),在盲测子集上将医生评估的HR从14.1%降至5.1%,并将DID从72.8%提升至91.6%。这些增益得到独立于HGNN的规则引擎安全评分印证(RSS:86.4%,较ORPO高21.2个百分点;与CSS一致性r=0.97)。尽管参数量处于10倍劣势,该方法在所有安全指标上也超过GPT-4(5-shot),并以11.4个百分点的CSS优势超过推理时自我纠错管线(SFT+SelfCorrect)。在合成EHR式噪声下仍保持84.2%的CSS。消融分析显示HGNN评分(-16.2个百分点)与迭代训练(-11.5个百分点)是主要贡献因素。PhysioScore针对200个临床医生标注的校准得到ECE=0.038与kappa=0.91。结论:在受控评估下,训练时生理知识锚定为开放权重临床LLM带来可测量且可独立验证的安全改进。这些增益能否迁移到部署环境,仍需在真实临床数据上进行外部验证。