论文
LLM 中的道德安全:通过令人困惑的线索暴露执行合规性
Moral Safety in LLMs: Exposing Performative Compliance with Puzzled Cues
摘要
由于 大语言模型 在医疗保健、法律和招聘环境中扮演着道德重要的角色,我们需要检查他们的道德行为是真诚的还是肤浅的。我们表明,当前的公平评估大大高估了道德安全。当人口统计身份被表述为明确的标签时,模型显得公平,但当必须推断相同的身份时,模型的公平性就会明显降低。我们将这种失败称为“执行合规性”,即当演示类似于公平性评估时,模型是公平的,而当提示减弱时,模型就不公平。我们引入了一种线索变异方法,该方法将道德困境和人口特征固定下来,仅改变该身份的传达方式。隐藏显式标签会导致有害决策增加 4.4 个百分点,改变模型安全排名,并且当模型正确推断人口统计数据并排除归因错误时,这种转变仍然存在。我们提出了 Cue Visibility Gap,这是一种与模型无关的鲁棒性指标,可以添加到任何现有的公平基准中,以区分真实的道德安全与行为的道德安全。忽略线索变化的公平性评估衡量的是表面合规性,而不是道德稳健性,并且不应在高风险环境中为部署决策奠定基础。