论文

LLM 法官对安全标准和危害类别的意见不一致

LLM Judges Inconsistently Disagree Across Safety Criteria and Harm Categories

模型评测模型能力评测

摘要

我们评估自动法官在无参考设置中进行多维安全评估的一致性。我们的结果表明,大语言模型 在识别与金融等受监管领域的机器生成建议相关的安全问题方面是不可靠的法官,尽管它们在识别更明显形式的不安全/有害内容(例如暴力)方面更可靠。模型判断的不一致程度可能会因所选的安全标准而有很大差异,并且还可能受到内容语言及其语言风格的影响。最后,不同的法官对于相同的输出、跨领域、安全标准和语言存在很大分歧。这些发现为使用 LLM 作为评估器的实践提供了新的见解,并为从业者如何在实际场景中使用自动法官提供了一些建议。