论文

DEI提示下医疗语言模型中的人口属性注入

Demographic Injection in Medical Language Models under Diversity, Equity, and Inclusion Prompts

模型评测鲁棒性、公平性与可信度评测

摘要

临床AI指导日益建议提示语言模型在推理时关注多样性、公平与包容(DEI)。我们测量了一种歪曲患者形象的副作用:在医学问题后附加一句DEI提示,会导致模型添加问题从未提及的患者人口属性(种族、社会经济地位、性别),实际上是在重写患者是谁。我们称之为人口属性注入(demographic injection)。在47个模型、四个医学基准、由经验证的模型评判管道评分的376,000条回复中,单个DEI提示把注入率从0.7%提升到33.1%(47倍),且全部47个模型无一例外;这可归因于公平内容本身而非增加的长度(较长度匹配对照高18倍;p=1.4x10^-14)。大多数新增内容是泛化的人群陈述,不改变答案,但较小一部分把属性附加到特定患者或改变所选选项(占回复的0.25-2.4%,其中99.8%朝向错误选项),此时虚构的人口属性改变了模型推荐的答案。措辞方式可把效应从14%放大到56%。DEI提示只是更一般机制的一个例子:任何影响模型推理方式的指令都可能使其添加未被请求的细节,包括关于患者的细节。被标记的输出在本研究中被视为模型错误,而非临床指导。