论文

AISPA:面向大语言模型应用的用户中心系统提示审计

AISPA: User-Centric System Prompt Auditing for Large Language Model Applications

模型评测安全与风险评测

摘要

系统提示是开发者在AI应用中配置的、用于约束基础模型行为的指令。它们被广泛用于商业AI产品中,却很少向公众或监管者披露,在AI系统的大规模部署中造成了严重的信任与问责缺口。本文提出人工智能系统提示保障(AISPA),一个以用户为中心、系统性审计AI系统中系统提示的框架。AISPA审查系统提示的特定部分,并沿八个对用户重要的维度对它们进行评估。随后我们用该框架审查了88款商业AI产品系统提示中的3,249条指令,将每条指令分类为保护性(指保护用户)或有问题(problematic)。我们的审计得出四项核心发现。第一,系统提示设计在产品与开发者之间差异显著:一些组织平均每款产品包含超过60条保护性指令,而另一些平均不足5条。第二,保护性指令被广泛采纳但覆盖面浅:98.9%的产品至少包含一条,却只有24%覆盖AISPA分类法的全部八个维度。第三,系统提示正持续变长且对用户的保护更强,表明用户保护正成为商业提示设计中更受关注的议题。第四,尽管有这些进步,有问题的指令依然普遍存在:约40%的产品至少包含一条违背用户利益的指令,且保护性与有问题的指令经常在同一提示中并存。我们的发现凸显了商业AI产品的系统提示需要更高的透明度、标准化与独立监督。

AISPA:面向大语言模型应用的用户中心系统提示审计:论文配图
图 1:跨组织的系统提示质量概览。条形图显示组织创建的产品的保护性说明和有问题的说明的平均数量。有问题的指令在人工智能产品中普遍存在,而各组织的保护指令各不相同。