CORDA:评估大语言模型层级化伤害中心道德推理的基准
CORDA: A Benchmark for Hierarchical Harm-Centric Moral Reasoning in Large Language Models
摘要
道德判断的关键问题并不只是某人是否选择了“正确”答案,而是当道德原则相互冲突时,他们如何决定什么最重要。当前对大语言模型(LLM)的评估仍然有限:大多数测试考察模型是否给出道德上可接受的答案、是否匹配人类偏好、是否避免明显违规,而非当没有任何选项在道德上毫无代价时,模型能否在相互竞争的原则之间排出优先级。我们提出CORDA(Conditioned Ordering and Ranked Directive Adherence),一个用于评估大语言模型层级化、以伤害为中心的道德推理的基准。基于道德链(morality chains)形式化,CORDA在四个有序伦理框架(Utility、Utility + Agent Harm、Dual-Process、Dual-Process + Agent Harm)下测试90个道德困境,涉及电车难题式案例、医疗权衡、资源分配以及人-动物-机器人冲突。这些框架共同检验当道德优先级变化时,模型能否调整其决策。在来自七家提供商的十个指令微调模型上,我们发现强烈的义务论默认倾向:10个模型中有9个优先避免直接的人身伤害,而非减少总体伤害。模型在类别化伤害规避规则(如避免杀害)上的表现也比在基于结果的比较(如最小化总体伤害)上更可靠,这表明它们识别道德红线比在相互竞争的伤害之间推理要容易。尽管所有模型都能响应显式的链式条件设定,但若干模型未能一致地遵循指定的优先级排序,例如人优先于动物、动物优先于机器人。CORDA通过检验模型能否超越默认的伤害规避式回应并应用情境指定的道德优先级,弥补了大语言模型道德评估的一个核心空白。道德可靠性需要的不只是默认的克制,还需要冲突下的可控性。
