论文

忠实还是捏造? LLM 法官中合理化偏见的因果框架

Faithful or Fabricated? A Causal Framework for Rationalization Bias in LLM Judges

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 越来越多地用作摘要和对话评估的自动判断器。之前的工作记录了诸如立场、冗长和风格偏好等偏见,但主要关注结果,从而导致法官的解释未被充分探索。相反,我们询问 LLM 法官是否具有线索不变性,即,当非证据线索受到干扰而底层文本保持固定时,他们的排名和解释是否保持稳定。我们引入了一套线索干预措施(盲法、真相法、翻转法、安慰剂法、揭示后法)和关系感知指标,用于量化结果锚定和理由锚定,包括标签对齐的修辞和解释漂移,以及一致性和刻板印象入侵检查。我们使用冗长和置信线索设计锚定攻击,并比较两种缓解措施:结构化思维链提示和 PROOF-BEFORE-PREFERENCE(证据锁定、分数、排名)。使用来自传统提取模型和 LLM 的 1,000 个摘要的新数据集,我们发现在标签和安慰剂扰动下存在大量线索锚定的合理化,而 PROOF-BEFORE-PREFERENCE 显着改善了基线上的线索不变性。