论文

Six Llamas:通过LoRA适配语言模型进行的比较宗教伦理研究

Six Llamas: Comparative Religious Ethics Through LoRA-Adapted Language Models

模型评测模型行为与机制分析

摘要

我们提出Six Llamas,一项比较研究,考察在不同宗教语料上微调的大语言模型是否编码了系统性不同的伦理推理模式。我们构建了Meta-Llama-3.1-8B的六个变体:一个未修改的对照组,以及五个分别仅在基督教、伊斯兰教、犹太教、印度教或佛教的圣典与神学文本上训练的LoRA适配模型。所有六个模型都用完全相同的17个标准化伦理提示组进行探测,涵盖道德困境、博弈论场景、公共政策问题和道德心理学自我评估。为评估鲁棒性与可复现性,我们实现了跨越十个温度设置的多温度采样设计。我们计算了四个提示域上的响应一致性指标、成对的模型间一致率、温度敏感系数以及逐次运行的稳定性分析。发现表明,LoRA适配模型产生的伦理推理模式(a)与基础模型系统性地区分开来,(b)与其训练传统的道德逻辑一致,(c)在道德哲学空间中沿可解释的维度结构化,(d)对于高共识困境,其核心伦理立场在温度变化下保持稳定。电车难题在所有模型和温度下均达到100%一致性,而(e)在道德上有争议的领域中,传统特有的分歧随温度升高而加剧,(f)基础模型表现出最高的总体响应一致性(平均88.3%),这表明LoRA适配既引入了传统特有信号,也增加了采样敏感性。本研究为凝聚比较方法(condensate comparative method)提供了概念验证——将差异化训练的语言模型用作文化与伦理分析的工具,并给出了具体的可证伪标准与计划中的扩展。