论文
VISOR:用于测试机器人的基于视觉语言模型的测试预言机
VISOR: A Vision-Language Model-based Test Oracle for Testing Robots
摘要
测试机器人需要评估它们是否正确、可靠且高质量地执行预期任务,这一挑战在软件测试中被称为测试预言问题。传统上,这种评估依赖于任务特定的符号预言来确保任务的正确性,并依赖于人类对机器人行为的手动评估,这是耗时、主观且容易出错的。为了解决这个问题,我们提出了 VISOR,一种基于视觉语言模型 (VLM) 的方法,用于自动测试预言机评估,消除了昂贵的人工评估的需要。 VISOR 对任务正确性和质量进行自动评估,解决了现有符号测试预言机的局限性,这些测试预言机是特定于任务的,并提供通过/失败判断,而无需明确量化任务质量。鉴于 VLM 固有的不确定性,VISOR 还在测试评估期间明确量化了其自身的不确定性。我们使用两个 VLM(即 GPT 和 Gemini)在 1,000 多个视频的四项机器人任务中评估了 VISOR。结果表明,Gemini 实现了更高的召回率,而 GPT 实现了更高的准确率。然而,这两个模型都显示不确定性和正确性之间的相关性较低,这阻止了使用不确定性作为正确性预测因子。