论文

安全是情境性的,LLM裁判不是:导航评估LLM裁判的僵化先验

Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型作为法官是大规模评估安全性的唯一方法。尽管大语言模型法官很重要,但他们本身很少以简单、静态的基准进行超出人类共识的评估。因此,我们研究了大语言模型作为法官的两个尚未充分探索但至关重要的属性:他们对上下文信息的依赖的敏感性,以及他们对不同安全定义的可引导性,这可能与他们的内部安全先验不一致。我们评估了许多通才大语言模型和安全专业法官的安全判断能力,并调查了任务演示、新颖的上下文信息和不断变化的安全定义的影响。我们发现,虽然大语言模型法官可以从新信息中学习,但如果背景或安全定义与他们之前的定义相矛盾,他们通常不太可能调整他们的评估。

安全是情境性的,LLM裁判不是:导航评估LLM裁判的僵化先验:论文配图
图 1:我们测试大语言模型安全法官是否能够遵循特定的安全政策,以及他们是否容易使用上下文信息(演示和有关用户请求的附加信息)。