论文
AI医生看重什么?审计语言模型临床伦理中的多元性
What Does the AI Doctor Value? Auditing Pluralism in the Clinical Ethics of Language Models
摘要
医学本质上是多元的。自主、行善、不伤害与公正等原则时常冲突,此类伦理困境往往使理性的医生之间产生尖锐分歧。良好的临床实践是结合每位患者的价值观来化解这些张力,而非强加单一伦理立场。然而,大语言模型在医疗建议中带入的伦理价值观尚未得到系统检视。我们提出一个审计医疗AI价值多元性的框架,包含一个由临床医生核验的困境基准,以及一种直接从决策中还原价值优先级的方法。前沿模型生态呈现出医生级别的价值异质性,且模型在作出决策前会在推理中讨论相互竞争的价值观(表层多元主义,Overton pluralism)。然而,单个模型的决策在重复采样和语义变化下近乎确定,未能复现医生小组的分布性多元。在基准案例中,这些一致的决策反映出坚定而系统的价值偏好。虽然多数模型优先级落在医生间差异的自然范围之内,但有些模型显著低估了患者自主权的权重。在部署时不顾其价值优先级的单个LLM,可能把这些优先级放大并施加于其服务的每一位患者。若不有意识地在单个或多个模型之间平衡伦理视角,这些工具就有用部署上的单一栽培取代临床多元性的风险。
