论文

面向申请追踪系统的反事实偏见测试

Counterfactual Bias Testing for Application Tracking System

模型评测评测方法与指标

摘要

自动化候选人-职位匹配系统在新兴监管下越来越多地被归类为高风险AI,但对其人口统计偏见进行审计成本高昂:经典的函件审计研究需要手工制作简历并手动投递,无法扩展到快速的流水线再训练周期。本文提出一种通用、可复用的方法学:(1)使用任务专用LLM智能体合成身份中立的基准简历,并在五个受保护特征轴(性别、年龄、居住地、语言、残障)上注入受控人口统计处理,生成K×(1+N)的函件审计矩阵;(2)依据与欧盟AI法案对齐的提示定性标记推断出的受保护特征;(3)通过微调的句子嵌入模型和余弦相似度针对职位描述对候选人排序;(4)计算包含九项指标的公平性套件,涵盖反事实(分数差、平均绝对排名变化、翻转率)、群体公平(top-K保留率、五分之四/影响比)和绩效感知(Recall@K、nDCG@K、机会均等、均等几率)三类,每项均配自助法置信区间、显著性检验和Benjamini-Hochberg校正,最终生成带综合风险分的自动化PASS/INVESTIGATE/FAIL报告。在包含5个职位订单、100名基准候选人和10种人口统计处理(90次指标×变体评估)的示例语料上:分数变化、top-K保留率和绩效感知比率差距在每种处理下都保持在容差之内,但排名稳定性指标(MARC)和nDCG@K各自发现了临界结果——包括中性基线本身上的一例——这是仅看分数或保留率会遗漏的。结果支持多指标、多族群的审计而非任何单一聚合分数,并支持将LLM智能体生成的审计作为人工策划审计的实用、低成本补充,适用于任何候选人-职位匹配流水线。

面向申请追踪系统的反事实偏见测试:论文配图
图2:示例语料上按偏差变体的得分差(每个变体 n=500n=500 对配对候选)。柱色编码 PASS(绿色);全部九个变体均通过 |Δ|≤0.02|\Delta|\leq 0.02 阈值。