论文

在LLM评估的海洋中航行:毒性基准中的偏差研究

Navigating the Sea of LLM Evaluation: Investigating Bias in Toxicity Benchmarks

模型评测鲁棒性、公平性与可信度评测

摘要

LLM在研究与产业中的快速采用凸显了安全部署的挑战,也暴露出毒性基准系统性评估方面的缺口。随着组织日益依赖这些基准为面向客户的应用与自动化审核认证模型,未被识别的评估偏差可能导致部署脆弱或不安全的系统。本工作考察既定基准设置的鲁棒性,并研究如何测量当前被忽视的内在偏差,例如与模型选择、指标和任务类型相关的偏差。我们的实验发现,当评估设置被改变时,基准行为会出现显著差异。具体而言,将任务从文本补全改为摘要会增加基准将内容标记为有害的倾向。此外,某些基准在输入数据域改变时无法保持一致行为。此外,我们还观察到模型特有的不稳定性,这清楚表明需要更鲁棒、更全面的安全评估框架。