论文

社会压力破坏了 LLM 安全面板的多数投票

Social Pressure Breaks Majority Voting in LLM Safety Panels

模型评测安全与风险评测

摘要

大语言模型 (LLM) 越来越多地用于检测不安全内容。一种常见的方法是结合一组模型的判断来纠正个别错误,但当每个模型在投票前看到相同的误导性背景时,这种好处可能会消失。我们通过受控的两轮实验研究了这种风险。每个模型首先单独判断一个项目,然后在六个模拟同伴断言错误标签或弃权后再次判断。我们以多数票的方式结合最终的判决。在六个开放权重 LLM 和六个数据集中,我们发现错误标签的同行消息将平均审稿人误报率从沉默同行下的 56.5% 提高到 87.5%,而多数投票将小组误报率提高到 100%。如果没有明确的标签,同一小组的表现就会优于其平均成员。其效果是极不对称的:审核者关注“不安全”的推送远多于关注“安全”的推送(大约 75% 对 17%),因此专家组的误报率急剧上升,而有害漏报率变化不大。专有模型探头显示不同模型之间存在显着差异。这些结果将共享社交线索的敏感性识别为安全面板的故障模式,并提供了简单的部署前诊断。