论文
AI安全评估的跨情境转化问题
A Translational Note on AI Safety Evaluation
摘要
最近的研究报告称,在标准人工智能安全基准上,自动红队比人类红队以更低的成本发现更多漏洞,一些人将此视为人类评估员变得可有可无的证据。比较衡量的是一件事,而结论却是另一件事。基准衡量攻击者搜索一组预定义危害的彻底程度,这些危害由开发人员提前修复,并且该组中遗漏的危害对于在其中工作的任何攻击者来说都是不可见的,无论是否自动化。同样的盲点也出现在学术密码学和临床药物试验中,在这些试验中,内部有效的评估对其从未针对的人群保持沉默。我们将人工智能安全版本称为 威胁模型覆盖差距,并发现它在当前的开放权重模型中持续存在,其中非英语提示中的危害表面是英语基准所遗漏的。关闭它需要部署上下文与开发人员不同的评估者。这些评估者的理由是方法论上的,以覆盖范围为基础的,现有的评估框架不太可能自行产生它们。