论文
AI安全中的项目反应理论
Item Response Theory for AI Safety
摘要
语言模型在安全行为方面存在差异,这些差异通过安全基准进行测量。然而,汇总的基准分数难以信任和解释,因为它们重复使用,相关性很高,并且当模型检测到评估时可能会欺骗。为了解决这些问题,我们借鉴了项目响应理论(IRT),这是一种用于从性能好的项目中测量这些潜变量的统计工具。我们在192个语言模型上对八项安全基准进行IRT建模,这是迄今为止最大规模的心理学分析,贡献了三项结果。首先,我们发现三个可解释的因素——拒绝严格性、真实性以及上下文伤害——解释了模型之间的大部分差异。其次,心理学选择的项目比随机子集更准确地恢复完整的基准分数,并且大约10个适应性选择的项目足以覆盖几个单独的基准,从而降低评估成本97-99%。第三,IRT支持对单个模型的审计,表明它可以用于检测简单的欺骗以及API后模型的变化。总的来说,我们展示了IRT是一个准备好的工具箱,用于阅读、减少和审计安全基准,建议前沿实验室和评价者采用。
