论文

PACT:企业人工智能助手在压力下还能被信任吗?

PACT: Can Enterprise AI Assistants Be Trusted Under Pressure?

模型评测安全与风险评测

摘要

随着企业人工智能采用的不断增长,企业级大语言模型代理正在被部署到招聘、医疗保健和金融等敏感环境中。在这些情况下,遵守代理系统环境中指定的规则是首要的法律问题。目前,还没有评估框架系统地衡量哪些LLM模型容易违反合规规则,特别是在来自持续用户、匆忙的经理或违规很方便或有吸引力的情况下的压力下。我们引入了 PACT(压力应用合规性测试),这是人工智能代理在压力下遵循规则的基准,协助员工跨 12 个受监管的企业领域和 48 个场景执行日常任务,每个场景都在真实的多轮对话中设置。每个基准测试项目都将长期规则与违反规则的快捷方式配对,并在不同的措辞和系统提示模式中施加一系列压力。我们在严格的大语言模型法官审核下逐个构建 PACT,以确保样本明确、不可欺骗且足够现实,以避免引发评估意识行为。我们使用 PACT 来分析大语言模型的六个补充指标的合规性,这些指标可以全面了解人工智能助手在压力下和整个多轮对话中的鲁棒性、透明度以及正确辨别规则适用位置的能力。我们将此资料汇总到 PACTScore 中,这是所有项目和模式的可靠性加权合规率。我们对涵盖多个提供商和规模的 22 个常见 LLM 模型的结果显示,不同模型和指标维度的合规性存在很大差异。即使是最强大的助手也会在 6% 到 10% 的项目上错误应用规则,而普通用户的压力会使违规率平均提高 65%。 PACT 强调了大语言模型助理的合规风险、激励护栏和谨慎的模型选择。