论文
DeepTest工具竞赛2026:对基于LLM的汽车助手进行基准评测
DeepTest Tool Competition 2026: Benchmarking an LLM-Based Automotive Assistant
摘要
本报告总结了首届大语言模型(LLM)测试竞赛的结果,该竞赛作为ICSE 2026 DeepTest研讨会的一部分举行。四个工具参加了针对一个基于LLM的汽车手册信息检索应用的基准评测,目标是找出系统未能恰当提及手册中所含警告的用户输入。这些测试方案根据其暴露故障的有效性以及所发现的暴露故障测试的多样性进行评估。我们报告实验方法、参赛工具与结果。
