论文
VIABench:从盲人那里收集的用于视力障碍援助的综合视频基准
VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance
摘要
由于视觉信息的获取有限,视障人士 (VII) 每天都会遇到重大挑战。尽管多模态 大语言模型 (MLLM) 在一般视觉和语言任务上取得了令人印象深刻的成果,但它们在现实世界盲人辅助中的实用性仍然很大程度上尚未得到充分探索。为了填补这一空白,我们推出了 VIABench,这是一个综合视频基准测试,专门设计用于使用 VII 自己录制或共享的第一人称视频来评估视障辅助场景中的 MLLM。 VIABench 定义了三个核心任务,每个任务都针对视觉辅助的不同要求。主动提醒:评估模型解释正在进行的视频内容的能力,同时主动预测和口头描述即将发生的导航关键事件;视觉问答(VQA):评估模型回答用户提出的有关视频中环境或物体的问题的能力;视觉引导交互:测试上下文感知推理以完成用户和环境之间的有意交互。为了确保稳健和公平的评估,我们提出了一个严格的基准测试管道,支持在线(实时)和离线设置。我们的实验表明,当前的 MLLM 仍然难以为 VII 提供全面的支持,特别是在主动提醒任务中,这需要准确的预测和实时响应。我们希望 VIABench 能够推动未来的研究,开发用于现实世界援助的定制 MLLM,最终改善视障人士的导航和交互体验。代码和数据将在https://github.com/MCG-NJU/VIABench发布。