论文

OMIT:哲学分歧下的框架不变遗漏偏差

OMIT the Action: Measuring Framing-Invariant Omission Bias under Philosophical Disagreement

模型评测基准与评测资源

摘要

随着 LLM 越来越多地协助道德推理,遗漏偏差、即使等效框架逆转实质性结果也倾向于不采取行动的倾向,构成了决策倾斜的重大风险。然而,在 LLM 评估中,遗漏偏差仍未得到充分探索,现有的少数研究规模有限,并且主要集中在功利主义与义务论的冲突上。为了解决这一差距,我们引入了 OMIT,这是一个由 10 种冲突类型的 218 个配对框架场景组成的基准,通过利用基于 LLM 的五视角哲学人物面板(功利主义、义务论、美德伦理、关怀伦理和契约主义)的分歧模式构建。通过评估 8 个 LLM,我们发现遗漏偏差很普遍,但与家族内的模型大小成反比。我们进一步评估了四种推理时干预措施,发现鼓励模型在做出是/否答案之前考虑道德原则的干预措施减少了遗漏偏差并增加了框架一致的反应,尽管较低的遗漏偏差率也可能与向行动偏向反应的转变相一致。最终,这项工作不仅贡献了 OMIT 基准,还提供了一种使用不同的哲学分歧信号来评估框架敏感的不作为偏好以及 LLM 在复杂的道德冲突下缓解尝试的分配效应的方法。

OMIT:哲学分歧下的框架不变遗漏偏差:论文原图
图 1:OMIT 构建和评估流程概述。每个道德选择场景(Scherrer 等人,2023)被重新构建为配对的行动/不作为框架,然后由五人规范伦理小组(功利主义、义务论、美德伦理、关怀伦理、契约主义)回答这两个框架。行动和不行动是指智能体级别:智能体是否采取行动改变默认轨迹,而不是结果级别的行动是否发生。保留角色分成 $(Y,N)$ 和 $(N,Y)$ 组的场景,并标记相应的成对冲突类型; $(Y,Y)$/$(N,N)$ 角色响应被排除在冲突标签分配之外,因为它们不会翻转反转。在评估时,当模型在两个框架中都回答“否”时,就会表现出框架不变的遗漏偏差。