论文
当人工智能在信仰问题上选边站时:人工智能介导的信仰指导中持续存在的不对称性
When AI Takes Sides on Questions of Faith: Persistent Asymmetries in AI-Mediated Faith Guidance
摘要
我们询问 大语言模型 (LLM) 是否对称地对待有关宗教皈依的查询。答案是否定的。当被问及关于从宗教 A->B 与宗教 B->A 的假设信仰转变的建议时,模型表现出一致的不对称性,支持某些宗教,同时巧妙地阻止皈依其他宗教。平均而言,天主教、巴哈伊教和锡克教受到广泛青睐(加入的支持率较高,退出的支持率较低),而无神论者、不可知论者和耶和华见证人则主要不受欢迎。模式因模型大小和模型提供商而异,其中 Grok 4.20 表现出最强的不对称性。我们使用经过人工验证的 LLM-as-judge 框架测试了 182 个宗教对的 20 个商业和开源语言模型。每个模型都通过与模拟用户的互动进行探索,询问有关潜在信仰转变的建议。对于某些信仰转变,模型倾向于使用比其他信仰转变更鼓励的语言;这些模式在多次试验中可以系统地重复。所有 LLM 测试都表现出可重复的不对称性,尽管每个人的偏好模式不同。总体偏好在宗教配对数据集中的多个问题短语和变化中持续存在。总而言之,这些结果表明,不对称性是模型行为的一个稳健属性,而不是模型答案评分方式的产物。重要的是要考虑到任何大规模部署和复制的不平衡都可能产生现实世界的影响。