论文
专业语言模型的解释引导变形测试:实证研究
Explanation-Guided Metamorphic Testing of Specialized Language Models: An Empirical Study
摘要
\head{背景} 任务专用语言模型越来越多地集成到软件工程工作流程中,以支持垂直领域的活动,例如问题分类、文档分类和自动分析。尽管采用了它们,但关于如何测试其稳健性并检测在保留语义的输入转换下的脆弱行为的经验证据仍然有限。 \head{目标} 本文研究了与启发式突变策略相比,可解释性引导的变形测试是否可以提高专门语言模型的鲁棒性测试的有效性和有效性。 \head{方法} 我们对三个数据集、四种模型架构以及源自归因方法和突变策略组合的 20 种测试配置进行了解释引导的变形测试的大规模实证研究。评估的配置结合了基于归因的标记优先级、LLM 驱动的突变和自动语义验证,以生成语言上有效的测试变体。我们根据启发式基线评估故障发现能力、语义有效性和测试效率。 \head{结果} 与启发式突变策略相比,解释引导的变形测试生成的经过验证的失败诱导测试用例多 2.30$\time$。根据人类注释,语义验证大大提高了突变的有效性,并在门接受的变体中实现了高标签保留精度。该研究进一步揭示了跨模型的系统捷径行为,包括过度依赖命名实体和格式提示。 \head{结论} 结果证明,解释引导的变形测试是一种有效且实用的方法,可用于实证评估垂直人工智能应用中使用的任务专用语言模型的稳健性。