论文
保留能力的简历干扰暴露了大语言模型筛选中的表现敏感性
Competence-Preserving Resume Perturbations Expose Presentation Sensitivity in LLM Screening
摘要
简历筛选人员必须从简历中推断出与工作相关的能力,简历的表述在措辞、结构、文体修饰和文档提取质量方面可能存在很大差异。理想情况下,当潜在的资格证据不变时,这种表面变化不应改变决策。我们对此属性进行受控审核,在受控能力水平上构建基于职业的候选人资料,并将每个资料呈现为多个简历演示文稿。确定性验证门排除了在评分之前改变潜在证据的变体。在六个开放式指令调整的大语言模型条件中,我们发现筛选有效性和表现稳定性之间存在明显的脱节。 Llama-3.1-8B 及其原生聊天模板实现了最强的有效性 ($0.781$),但在保留能力的演示更改下逆转了 $29.6\%$ 的匹配成对决策; Mistral-7B-v0.3 的有效期为 0.644$,翻转率为 41.4\%$。本机聊天格式提高了多个聊天调整模型的有效性,但并没有消除这种不稳定性。这些结果表明,简历筛选评估不仅应该评估系统是否识别出更优秀的候选人,还应该评估当相同的能力证据以不同的方式呈现时,这些决策是否保持稳定。