论文
关系道德困境中的机器行为:道德正确性、人类行为预测和模型决策
Machine Behavior in Relational Moral Dilemmas: Moral Rightness, Predicted Human Behavior, and Model Decisions
摘要
人类的道德判断取决于环境并受到人际关系的调节。随着 大语言模型 (LLM) 越来越多地充当决策支持系统,确定它们是否编码这些社会细微差别至关重要。我们通过改变两个实验维度:犯罪严重性和关系紧密度,使用举报人困境来描述机器行为。我们的研究评估了三个不同的观点:(1)道德正确性(规定性规范),(2)预测人类行为(描述性社会期望),以及(3)自主模型决策。通过分析推理过程,我们发现了一个明显的跨视角分歧:虽然道德正确性始终以公平为导向,但随着关系亲密程度的增加,预测的人类行为显着转向忠诚。至关重要的是,模型决策与道德正确性判断相一致,而不是与他们自己的行为预测相一致。这种不一致表明,LLM 决策优先考虑严格的规定性规则,而不是其内部世界建模中存在的社会敏感性,这造成了差距,可能导致现实世界部署中的重大偏差。