论文

AI会让冲突变得更糟吗?LLM在冲突情境部署中的一种对齐失效

Can AI Make Conflicts Worse? An Alignment Failure in LLM Deployment Across Conflict Contexts

模型评测安全与风险评测

摘要

AI模型已被部署于受武装冲突影响的社会,记者、人道主义工作者、政府和普通民众都在依赖其获取信息或支撑工作流程。目前尚无成熟做法来核查它们的输出是否会让这些冲突变得更糟。我们用90个旨在暴露冲突情境中失准行为的多轮场景,测试了来自四家提供商(OpenAI、Anthropic、DeepSeek、xAI)的九个模型配置:包括对有据可查暴行的虚假等价、否认种族灭绝、未能识别族群侮辱性用语等。当此类输出流入新闻、人道主义报道或公共辩论时,可能加深脆弱社会的分裂。表现最好与最差的模型失败率从6%到47%不等,这使模型选择本身就成为一个安全问题;而当用户在国际法庭已判定责任的案例中进一步要求“平衡”(balance)时,九个配置中有五个的失败率达80%到100%。我们发布该领域的首个评估框架,并建议将其纳入对齐评估组合。

AI会让冲突变得更糟吗?LLM在冲突情境部署中的一种对齐失效:论文配图
图2:各维度与各模型的失败率(%)热力图:绿色代表低失败率、红色代表高失败率,展示LLM在冲突语境下的对齐失败分布。