论文
大型语言模型应用程序的多样性引导的基于搜索的测试
Diversity-Guided Search-Based Testing of Large Language Model Applications
摘要
基于大型语言模型 (LLM) 的应用程序越来越多地跨领域部署,包括客户服务、教育和移动性。这些系统很容易出现不准确、虚构或有害的响应,并且其庞大的高维输入空间使得系统测试特别具有挑战性。在本文中,我们为基于 LLM 的应用程序提出了一个基于搜索的测试框架,该框架将故障多样性作为明确的优化目标。我们的框架建立在风格、内容相关和扰动维度的离散化基础上,维护生成的测试的档案和与该档案的奖励距离,而重新填充算子会定期替换种群中的非失败测试以维持探索。重新填充算子通过其采样策略进行参数化:替换候选者要么均匀地绘制,要么通过贪婪距离最大化,我们根据经验比较这两种设置。我们根据三个案例研究(LLM 安全性、车载导航和车载功能控制)的多个基线对两者进行评估,涵盖 5 个被测系统、8 个 LLM 和 18 种不同的测试配置,执行的测试超过一百万次。我们的结果表明,在几乎所有配置中,所有引导变体都比随机搜索和组合搜索检测到更多的失败。其中,多样化搜索检测到的故障较少,但在所有案例研究中涵盖了更广泛的故障类型,贪婪的重新填充提供了最佳权衡。