论文
安全是情境性的,LLM裁判不是:导航评估LLM裁判的僵化先验
Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators
摘要
大语言模型作为法官是大规模评估安全性的唯一方法。尽管大语言模型法官很重要,但他们本身很少以简单、静态的基准进行超出人类共识的评估。因此,我们研究了大语言模型作为法官的两个尚未充分探索但至关重要的属性:他们对上下文信息的依赖的敏感性,以及他们对不同安全定义的可引导性,这可能与他们的内部安全先验不一致。我们评估了许多通才大语言模型和安全专业法官的安全判断能力,并调查了任务演示、新颖的上下文信息和不断变化的安全定义的影响。我们发现,虽然大语言模型法官可以从新信息中学习,但如果背景或安全定义与他们之前的定义相矛盾,他们通常不太可能调整他们的评估。
