论文
安全标志:LLM 内容审核者可靠性和校准的统一基准
Safety-Flag: A Unified Benchmark for the Reliability and Calibration of LLM Content Moderators
摘要
大型语言模型越来越多地用于内容审核,但大多数评估仍然报告单个基准的总体准确性。我们引入了 Safety-Flag,它将七个广泛使用的安全基准(BeaverTails、XSTest、Ethics、WildGuard、Aegis、ToxiChat 和 ToxiGen)放入单个平衡标记/不标记协议中。我们发布了六名通用大语言模型和四名专用警卫的项目级决策和置信度评分,以及针对相同项目进行评估的三个参考模型。安全标志衡量主持人可靠性的三个维度:错误方向、概率校准和用于人工审核的基于置信度的错误排名。他们经常意见不一致。聚合准确度并不能揭示错误方向:一个模型标记了 $85\%$ 的良性内容,而另一个模型则错过了 $54\%$ 的有害内容。所有六种通用模型都过于自信;为每个模型拟合一个温度可将校准误差减少 $2.8$--$6.0\times$,而无需更改预测标签或置信度排序。基于置信度的弃权降低了每个模型的选择性风险,尽管收益取决于置信度对错误进行排序的程度。专门的警卫产生的误报较少,并且校准得更好,但有些警卫在其记录的覆盖范围之外的漏报率较高。我们在以下位置发布了基准测试、固定项目列表、评估代码、每项目模型输出和排行榜:https://github.com/yibo-hu-lab/safety-flag-benchmark。