论文
每种行为都有其代价:前沿的道德成分压缩 LLM
Every Act Has Its Price: Compressed Moral Composition in Frontier LLMs
摘要
现有的 LLM 道德基准通常会询问模型更喜欢哪种孤立的道德行为、价值观或基础。这很有用但不完整。现实的判断通常需要一个模型将多个道德信号结合到同一选项中。我们引入 **Moral Trolley Arena**,这是一个两阶段盲 ELO 基准,用于衡量 LLM 如何构成道德证据。单场景竞技场首先从跨越五个道德基础理论基础的 229 个场景语料库中校准个人道德行为;然后,复合竞技场在受控强度网格上将校准后的行为组合成两行为道德项目,并测量由此产生的复合偏好。在十个前沿模型中,综合判断很大程度上是通过成分行为强度来预测的,但这种关系始终是压缩的,而不是简单相加的。模型还显示了非加性强度锚定、组件控制后有界基础特定残差以及跨提供商的高度收敛的复合偏好表面。这些结果表明,道德审计应该衡量道德证据的构成规则,而不仅仅是对孤立行为的排名。