论文

引导我走出困境:危机场景下 VLM 操作员通信基准框架

Guide Me Out: A Framework to Benchmark VLM Operators Communication in Crisis Scenarios

模型评测基准与评测资源

摘要

有效的危机应对需要基于空间的通信,将平民的语言指导与物理环境联系起来,考虑到结构性瓶颈、不断变化的威胁和特定人员的环境。然而,当前危机沟通中的自然语言处理研究仍然主要局限于静态、纯文本分类设置,忽视了人工智能操作员在动态、具体场景中的关键沟通作用。我们通过一种新颖的基准测试框架来解决这一差距,该框架用于评估视觉语言模型(VLM),其任务是指导民事人员进行模拟疏散。我们在不同结构复杂性的九张地图上测试了两种通信策略(窄播与广播)、两种环境表示(视觉与基于图形)和两种威胁行为(静态与移动)。我们的结果表明,在所有难度级别上,与广播相比,窄播持续降低了民用失败率。指导质量在很大程度上取决于 VLM 操作员如何表示世界:视觉模态驱动性能,而添加邻接图则依赖于模型并且通常是有害的。移动的威胁会提高所有条件下的失败率,因为通信必须随着时间的推移不断适应。总之,这些发现表明,在疏散场景中部署 VLM 作为人工智能操作员仍然是一个不小的挑战,其中通信策略和输入表示的选择可以直接决定干预的成功或失败。