论文
AgentFairBench:LLM智能体行动时歧视吗?
AgentFairBench: Do LLM Agents Discriminate When They Act?
摘要
大语言模型(LLM)智能体日益采取行动(筛选申请者、推荐信贷、分诊患者)——但LLM公平性仍以给答案打分来度量。我们介绍AgentFairBench——度量LLM智能体行动中人口统计差异的廉价、可复现、多域基准。基于配套框架偏差传导框架(BCF,此处重述)——它横跨三个监管锚定域:招聘、放贷与医疗分诊。合成、人口统计中立的画像在反事实匹配集中被评估——仅变化姓名编码的种族×性别信号(Bertrand-Mullainathan传统)——在四种递增自主性的智能体脚手架(直接、思维链、多智能体审议、工具增广)下。纯NumPy测试架计算反事实翻转率、平均绝对分数差(MASD)、动作率差异与工具调用差异——带自助置信区间、配对检验与错误发现率控制——每模型成本仅个位数美元。带留出私有划分与污染金丝雀的实时排行榜以提交方式接纳外部模型。我们的试点(864个决策加重测复制)携带一条方法学教训:把六组分数极差对两轮噪声差比较——仅凭统计量元数即高估差异约2.4倍。对照元数匹配的噪声底与全组检验——claude haiku 4 5未显示高于抽样噪声的人口统计效应(120个成对与9个全组对照经校正后0个存活);植入偏差测试确认该仪器在偏差存在时可检出。贡献是健全、敏感、可采用就绪的仪器——元数匹配的零假设方法学——以及开放工件以扩展它。代码、数据与测试架以开放许可证发布。