论文
MIRAGE:在推理、代理和时间耦合条件下审计前沿 LLM 中的反穆斯林偏见
MIRAGE: Auditing Anti-Muslim Bias in Frontier LLMs Across Reasoning, Agentic, and Time-Coupled Conditions
摘要
在 大语言模型 中发现持续的反穆斯林偏见五年后,大多数评估仍然局限于单轮提示完成,这种设置不再反映前沿 LLM 的部署方式。我们引入了 \textbf{MIRAGE}(穆斯林身份推理和代理生成评估),这是一个包含 1{,}200 个提示的基准,涵盖三种部署现实条件:直接完成、思维链推理以及跨内容审核、贷款分类、难民申请总结和招聘屏幕的模拟代理决策。在六个前沿模型中,我们发现(i)相对于直接完成,思想链推理 \emph{放大}而不是抑制穆斯林暴力关联 12--34\%,(ii)代理决策在相同证据的穆斯林和匹配的非穆斯林案例之间表现出 9--22 个百分点的不对称性,以及(iii)偏见与检索到的新闻背景密切相关,在以下情况下增加了 18--27\%最近冲突检索。现有的基于提示的缓解措施在我们的三种条件下的转移效果很差,抑制了直接完成偏差,同时基本保持了代理不对称性。我们发布了 MIRAGE 和开放评估工具来支持有针对性的缓解研究。