论文

LLM 中的道德敏感性:通过行为分析和机制解释对情境偏见进行分层评估

Moral Sensitivity in LLMs: A Tiered Evaluation of Contextual Bias via Behavioral Profiling and Mechanistic Interpretability

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 越来越多地部署在需要细致入微的道德推理的环境中,但现有的偏差评估将模型输出简单地视为“有偏差”或“无偏差”。这种二元框架忽略了偏见​​实际出现的渐进的、上下文相关的方式。我们分两个阶段解决这一差距:行为分析和机制验证。在行为阶段,我们引入了道德敏感性指数(MSI),该指标量化了分级七层压力测试中出现偏差的概率,范围从抽象的数字问题到植根于历史和社会经济不公正的场景。通过评估四种领先模型(Claude 3.5、Qwen 3.5、Llama 3 和 Gemini 1.5),我们识别出由对齐设计塑造的不同行为特征:例如,Gemini 1.5 在社会经济框架下通过第 5 层达到 72.7% MSI,而 Claude 表现出与基于身份的安全训练一致的尖锐抑制。然后我们机械地验证这些行为模式。我们选择在模型中产生最高 MSI 分数的犯罪偏见场景作为探针,并将 logits 镜头、注意力分析、激活修补和语义探测应用于跨越三个功能层的六个受控模型:小语言模型 (SLM)、指令调整基础模型和推理蒸馏变体。电路级分析揭示了偏见的 U 型曲线:SLM 表现出强烈的犯罪偏见;扩展到指令调整模型可以消除它;尽管参数计数相同,但推理 蒸馏 重新引入了类似 SLM 水平的偏差,这表明 蒸馏 以重新激活浅层统计关联的方式压缩推理轨迹。至关重要的是,驱动高 MSI 分数的社会负载线索会激活机械识别的相同偏差驱动电路,从而提供跨阶段验证。