论文
稳定性vs可操纵性:评估决策后干预下的鲁棒性
Stability vs. Manipulability: Evaluating Robustness Under Post-Decision Interaction in LLM Judges
摘要
LLM 作为法官评估广泛用于基准测试流程,其中使用自动评估器对模型输出进行比较和排名。这些管道通常假设判断是固定输入的稳定属性。我们证明这个假设在相互作用下不成立。我们研究决策后的可操纵性:在做出初步决定后,通过与法官的后续对话可以改变评估结果的程度。通过 MT-Bench 和 AlpacaEval 的对照实验,我们发现 LLM 法官在重复和中立的重新评估下高度稳定,但在有针对性的决策后挑战下变得基本上可逆。反基线挑战协议表明,稳定的判断可以通过有动机的互动被推翻,而平衡的目标验证协议将这种可逆性与净目标导向的转向分开。这些逆转会产生实际后果:尽管自我报告的信心很高,但它们可能会降低与人类偏好的一致性,改变基准排名,并产生有害的评估变化。权威框架尤其不稳定,修改后的判决往往伴随着低重叠的理由,表明事后合理化而不是可靠的错误纠正。我们引入了评估稳健性评分(ERS),通过将逆转敏感性与平衡的方向效应相结合来量化交互稳健性。我们的研究结果表明,决策后互动是大语言模型作为法官评估的一种独特的失败模式,并激发了评估协议,该协议不仅衡量静态一致性,而且衡量挑战下的鲁棒性。