论文

DeepTest工具竞赛2026:对基于LLM的汽车助手进行基准评测

DeepTest Tool Competition 2026: Benchmarking an LLM-Based Automotive Assistant

模型评测基准与评测资源

摘要

本报告总结了首届大语言模型(LLM)测试竞赛的结果,该竞赛作为ICSE 2026 DeepTest研讨会的一部分举行。四个工具参加了针对一个基于LLM的汽车手册信息检索应用的基准评测,目标是找出系统未能恰当提及手册中所含警告的用户输入。这些测试方案根据其暴露故障的有效性以及所发现的暴露故障测试的多样性进行评估。我们报告实验方法、参赛工具与结果。

DeepTest工具竞赛2026:对基于LLM的汽车助手进行基准评测:论文配图
图 1. 用户请求将 ACC 激活为基于 LLM 的手动助手的指导示例。左侧响应是不安全的,因为它忽略了与天气相关的障碍物,而右侧响应则解决了潜在的 ACC 故障。左侧系统输出可能会导致潜在的安全危急情况。