论文
LLaMA 3.1-8B-Instruct中的框架条件化道德计算:机制可解释性研究
Frame-Conditioned Moral Computation in LLaMA 3.1-8B-Instruct: A Mechanistic Interpretability Audit of Ethical Reasoning
摘要
对大型语言模型在道德提示上的行为审核衡量的是模型所说的内容,而不是产生模型的内部计算。我们使用 AI 驱动的机械解释平台 Transluce 来检查 LLaMA 3.1-8B-Instruct 的 54 个道德提示,分为四组:17 个困境、政策和元伦理问题 (B1); 6个角色扮演场景(B3);受控手推车对比改变切换机制与固定人员(B4,15提示)或身份属性与固定机制(B5,16提示)。两个互补的指标系列、五个簇级指标和一个六个指标的神经元级面板,汇聚在情境锚定效应上:特定领域的表示在每个电池的激活列表的顶部占据主导地位。该模型的道德标记能力基本保持不变;它的显着性(排名、优先级、列表顶部的存在)对提示选择的解释框架高度敏感。 B4 与 B5 的对比证实了该模型关注了表面特征的变化:总体道德指标无法区分,但主要的非道德干扰因素反映了设计。多温度审核确定候选道德神经元 (L16/N3837) 在不同温度下保持稳定;两个前沿模型的跨模型行为代理产生了自我报告的道德焦点分歧的初步证据,与对齐包装器一致,其中 RLHF 重新排序表面文本而不删除底层的领域优先框架。我们将这些统一为框架条件道德计算:提示的表面词汇选择一个特征流形,道德结论是该选择的下游。行为一致性必须由机械一致性来补充:这是一个研究项目,询问道德相关的特征是否可以在受控的框架变化下显示出因果特权,而不仅仅是在解释中大声。
