论文
基于搜索的车内场景理解视觉语言模型测试
Search-based Testing of Vision Language Models for In-Car Scene Understanding
摘要
在汽车领域,车内场景理解 (ISU) 能够检测驾驶员分心等安全关键事件,并通过分析车内场景和适应环境(例如环境照明)来为驾驶员或乘客提供支持。业界越来越多地探索视觉语言模型(VLM)来解释摄像头记录的车内场景并提取下游推理任务的信息。然而,VLM 可能会生成不完整、错误或误导性的场景描述,这凸显了系统测试的必要性。收集真实的车内数据成本高昂,难以扩展,而且通常不可行,尤其是在早期设计阶段。在本文中,我们提出了 ISU-Test,这是一种自动化测试方法,它将基于渲染的场景生成与基于搜索的测试相结合来评估 ISU 系统。通过将测试框架化为优化问题并系统地修改场景参数,我们的方法生成了不同的车内场景并探索了广泛的配置。我们通过两个案例研究在工业原型和开源 VLM 上评估 ISU-Test:问答和字幕,并与随机场景生成进行比较。结果表明,ISU-Test 的性能显着优于基准,故障率提高了 10 倍,故障覆盖率提高了 3.6 倍。