论文

探究 大语言模型 中的道德框架表征:结构、纠缠和方法论挑战

Probing Ethical Framework Representations in Large Language Models: Structure, Entanglement, and Methodological Challenges

模型评测模型行为与机制分析

摘要

当大语言模型做出道德判断时,他们的内部表征是否区分了规范框架,或者将道德崩溃为单一的可接受性维度?我们在跨越 4B--72B 参数的六个 LLM 中探讨了五个道德框架(义务论、功利主义、美德、正义、常识)的隐藏表征。我们的分析揭示了具有不对称转移模式的差异化道德子空间——例如,道义论探索部分地推广到美德场景,而常识性探索在正义方面遭遇了灾难性的失败。义务论和功利主义探索之间的分歧与架构中较高的行为熵相关,尽管这种关系可能部分反映了对场景难度的共同敏感性。事后验证表明探针部分依赖于基准模板的表面特征,因此需要谨慎解释。我们讨论这些方法提供的结构见解及其认识论局限性。