论文

RealityTest:人们如何探究人工智能身份以及模型是否披露了它

RealityTest: How People Probe AI Identity and Whether Models Disclose It

模型评测安全与风险评测

摘要

人工智能系统越来越多地部署在对话环境中,用户可能不确定他们是在与人类还是人工智能交谈。尽管监管机构对这种已知的安全风险越来越关注,但现有的人工智能披露评估通常仅是英语,基于机器生成的问题,并且仅限于文本。我们推出 RealityTest 来全面测试人工智能系统是否在被询问时透露其身份。该基准是第一个大规模的多模式和多语言评估,以人类数据为基础,了解人们在现实世界中如何实际遇到和质疑人工智能身份。除了基准测试之外,我们还发布了 3,152 个身份探测查询的基础数据集,这些查询是从 49 个国家/地区、五种语言的约 750 名参与者在文本和语音场景中收集的。我们发现,只有 31% 的人在模棱两可的场景中直接询问身份,而且人们提出的问题比机器生成的查询更加多样化。我们测试了 17 个文本模型和 6 个语音模型,发现披露行为存在很大差异。然而,即使在性能最佳的模型中,单个抑制指令也会将披露率降低至 30% 以下。验证我们对多样化、以人为本的评估数据的投资,我们发现问题的措辞方式和对话的背景对于披露而言比测试哪个模型更重要。基于狭窄或综合查询集构建的安全评估可能会错误地描述模型在实际部署设置中的行为方式。