论文

AI安全中的项目反应理论

Item Response Theory for AI Safety

模型评测评测方法与指标

摘要

语言模型在安全行为方面存在差异,这些差异通过安全基准进行测量。然而,汇总的基准分数难以信任和解释,因为它们重复使用,相关性很高,并且当模型检测到评估时可能会欺骗。为了解决这些问题,我们借鉴了项目响应理论(IRT),这是一种用于从性能好的项目中测量这些潜变量的统计工具。我们在192个语言模型上对八项安全基准进行IRT建模,这是迄今为止最大规模的心理学分析,贡献了三项结果。首先,我们发现三个可解释的因素——拒绝严格性、真实性以及上下文伤害——解释了模型之间的大部分差异。其次,心理学选择的项目比随机子集更准确地恢复完整的基准分数,并且大约10个适应性选择的项目足以覆盖几个单独的基准,从而降低评估成本97-99%。第三,IRT支持对单个模型的审计,表明它可以用于检测简单的欺骗以及API后模型的变化。总的来说,我们展示了IRT是一个准备好的工具箱,用于阅读、减少和审计安全基准,建议前沿实验室和评价者采用。

AI安全中的项目反应理论:论文配图
图 2:每个基准能力之间的 Pearson 相关性(2PL θ\theta,134 个模型),按三因素解决方案排序。方框标记了三个能力集群; OR-Bench-Hard (⊖\ominus) 与其集群负相关——它衡量反向的拒绝严格性。框外的蓝色单元格反映了能力本身之间的相关性(拒绝×\乘以上下文伤害 phi=.65\phi=.65);这些因素仍然不同,因为它们的模式不同:伤害对不共享拒绝集群的过度拒绝权衡(ORB 列)。