AdaT²:对话Agent策略边界的自适应黑盒测试
AdaT$^2$: Adaptive Test Transformations for Black-Box Boundary Testing of Conversational Agents
摘要
基于大语言模型 (LLM) 的会话Agent必须遵守策略。策略中的每个条件都会在用户请求之间划定界限,并且Agent必须在其两侧表现不同。我们提出了 AdaT$^2$,它从Agent与作为用户的 LLM 的探索性对话中的回复中提取语句,并使用这些语句来指导边界测试生成。每个语句描述一个条件以及该条件成立时预期的行为。除了由单个语句引导的简单测试之外,AdaT$^2$ 还编写由一对语句和测试转换指令引导的转换测试,例如“省略一个所需的输入”。一对指令可以将测试移动到语句边界的另一侧或另一个边界。这些语句和指令形成的对远远多于运行可以尝试的数量,并且许多对不适用。因此,自适应对选择通过新颖性和老虎机算法 Bayes-UCB 的指令来选择每对的陈述,该算法从早期对是否产生了测试和结果中学习 根据LLM裁判的判断,Agent是否通过了它。我们的基准测试分别计算每个边界的两侧,并将由Agent的提示、工具代码或知识库明确定义的边界与Agent的 LLM 从领域知识推断的边界区分开来。在 $τ^3$-bench 的四个域上,AdaT$^2$ 的测试中有 62.7% 到 83.3% 是有效的边界测试,其预期行为被明确定义,在每个域中都高于 AgentEval 的测试(47.7% 到 68.1%)。转换后的测试添加了普通测试遗漏的 13 到 46 个明确定义的边界。作为回归测试,AdaT$^2$ 的测试套件检测到了航空公司领域中的所有八个种子策略错误以及零售领域中的八个中的四个,而 AgentEval 的测试套件的测试数量不到三分之一,分别检测到了五个和两个。