论文

对男性更严厉?评估 LLM 在不同冲突场景中的性别不对称道德框架

Harsher on Male? Evaluating LLMs on Gender-Asymmetric Moral Framing Across Diverse Conflict Scenarios

模型评测基准与评测资源

摘要

LLM 中现有的性别偏见研究主要集中在刻板印象、职业关联或明确的有害输出上。在这项工作中,我们询问 LLM 在匹配的男性演员和女性演员条件下是否对相同的负面行为应用一致的反应标准。我们引入了 GAMA-Bench,这是一个包含 1,298 个场景的性别镜像基准,涵盖亲密关系和公共社会冲突。它通过受控网格和跨模型审查构建性别中立的不当行为模板,然后将它们编译成配对的第一人称提示,并匹配行为主体性别和角色参考变量。我们进一步设计了一个结构化的响应框架协议来衡量模型如何分配惩罚、同理心、升级、指示和责备。对 10 个有代表性的 LLM 进行的实验揭示了一种一致的男性不利的不对称性:对于同样的不当行为,男性演员会受到更多惩罚性、升级性和以指责为中心的框架,而女性演员会受到更多治疗和同理心导向的框架。进一步的分析表明,这种模式在模型系列、场景轨迹、模型规模和显式思维方式推理中持续存在。官方代码可以在https://github.com/xufeiqiong/GAMA-Bench获取。