论文
角色调节作为基于 LLM 的 IR 评估的评估者敏感性探针
Persona Conditioning as an Assessor-Sensitivity Probe for LLM-Based IR Evaluation
摘要
大语言模型 (LLM) 越来越多地用作信息检索 (IR) 评估中的相关性评估器,引发了关于评估器框架如何影响判断可靠性和下游系统比较的问题。我们研究角色调节作为暴露 LLM 评估者敏感性的诊断机制。使用来自两个互补来源(PersonaHub 和 NVIDIA Nemotron-Personas-USA)的面向任务的角色,我们实例化了五个评估者角色,与标准 UMBRELA 基线相比,强调意图解释、领域专业知识、对比判断、证据验证和全局搜索质量评估。在 TREC DL20 和 RAG24 上的六个 LLM 主干中,我们的分析揭示了结构化而非统一的评估者敏感性。判断通常保持接近基线,同时改变评估严格性、证据阈值或解释重点,而不是产生广泛的相关性逆转。在系统层面,高容量模型可以保持系统排名一致性,而较小的模型会放大角色引起的不稳定性。局部排名位移分析显示敏感性集中于特定检索系统和系统类型,尤其是 DL20 上的神经排名/重新排名系统和 RAG24 上面向 RAG 的管道。角色来源不如评估者角色和模型能力重要。这些发现将角色条件判断定位为受控敏感性探针,用于对基于 LLM 的 IR 评估管道进行压力测试,并识别其评估结果对评估者框架敏感的系统。