论文

语言模型如何组织和构建道德知识

How Language Models Organize and Structure Moral Knowledge

模型评测模型行为与机制分析

摘要

大语言模型(LLM)如何组织道德知识?模型广泛检测道德内容,但检测门槛较低。我们询问他们是否更进一步,将道德基础彼此区分开来,并以几何方式组织它们之间的关系。我们在开放权重语言模型上训练六个独立的线性探针,每个道德基础理论(MFT)类别(关心/伤害、公平/欺骗、自由/压迫、忠诚/背叛、auth/subv、sanc/degrade)一个,并检查结果方向在表示空间中如何相互关联。我们发现这些方向既不会崩溃为单一的道德探测器,也不会彼此孤立。相反,它们跨越了接近最大数量的独立维度,同时共享积极的共同成分。共享组件是集成的标志,并且相对于相同构建的匹配的非道德概念电池而言,它是特定于道德的(平均成对余弦 0.26 与 0.013)。几何结构在架构和规模上是一致的,并在 预训练 早期达到其集成状态,远远早于探针精度饱和。该模型发现的结构没有显示道德基础理论(一项动力不足的测试:仅存在 20 个候选分区)所预测的个体化/约束性区别的证据,而是反映了语料库统计数据。扩展到道德困境,每个困境方向部分地由其组成基础组成,为不匹配对基线的 2.7 倍,而其大部分方差编码了冲突特定结构。该模型代表了道德张力本身,而不是预先解决的判断。