论文

同情框架:评估跨社会人口群体的人工智能一致性

Sympathetic Framing: Evaluating AI Alignment across Sociodemographic Groups

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 正在日益塑造我们消费信息和形成世界观的方式。这引发了人工智能偏见之外的担忧:LLM 是否掌握了通过文本框架传达的情感细微差别?在这项工作中,我们凭经验评估了一系列 LLM 与人类情感感知的一致性。考虑到涉及政治和地缘政治冲突的新闻标题,人类参与者(n = 3011,英国成年人口的代表性样本,通过 YouGov 调查)和七名 LLM 回答了标题是否引起了对冲突中特定一方的同情。我们发现人工智能和人类评估之间的相关性因模型而异,范围从非常高(0.789,GPT-5.2)到中等(0.4,Mistral Large 2512)。至关重要的是,领先模型与所有人口亚群体的人类判断大体一致,包括年龄、性别、教育水平、先前的地缘政治知识以及参与者对冲突的倾向,尽管群体之间存在统计上的显着差异。这项研究以其稳健的设计和人口统计多样化的大型数据集,提供了迄今为止对 LLM 对新闻框架的理解的最全面的评估。研究结果强调了差异一致性的一个重要但经常被忽视的方面:即使总体表现很高,人工智能一致性也不是普遍的——它可能与人口特征和文化规范有不同的对应。因此,考虑或忽略差异对齐的需要可能会对道德和有用的人工智能系统的开发产生重大影响。