论文
LLMORPH:大语言模型 的自动变质测试
LLMORPH: Automated Metamorphic Testing of Large Language Models
摘要
自动化测试对于评估和提高 大语言模型 (LLM) 的可靠性至关重要,但缺乏用于验证输出正确性的自动化预言机仍然是一个关键挑战。我们推出了 LLMORPH,这是一款专为 LLM 执行 NLP 任务而设计的自动化测试工具,它利用变形测试 (MT) 来发现错误行为,而无需依赖人工标记的数据。 MT 使用变形关系 (MR) 从源测试输入生成后续输入,从而无需昂贵的标记数据即可检测模型输出中的不一致情况。 LLMORPH 面向想要评估基于 LLM 的 NLP 系统稳健性的研究人员和开发人员。在本文中,我们详细介绍了 LLMORPH 的设计、实现和实际使用,演示了如何将其轻松扩展到任何 LLM、NLP 任务和 MR 集。在我们的评估中,我们在四个 NLP 基准测试中应用了 36 个 MR,测试了三个最先进的 LLM:GPT-4、LLAMA3 和 HERMES 2。这产生了超过 561,000 次测试执行。结果证明了 LLMORPH 在自动暴露不一致方面的有效性。