论文

AMAVA:用于视障援助的自适应运动感知视频到音频框架

AMAVA: Adaptive Motion-Aware Video-to-Audio Framework for Visually-Impaired Assistance

应用与实践个人助理

摘要

盲人和低视力人士的导航辅助设备难以传达动态的现实世界环境,导致连续的、无差别的反馈导致认知超载。我们推出了 AMAVA,这是一种新颖的实时视频转音频框架,可将移动设备视频转换为上下文相关的音效或文本转语音描述。我们提出了一种运动感知管道,使用轻量级人工智能分类模型来区分低运动场景和高运动场景,然后使用实时文本到音频合成管道来更有效地增强环境感知。在静态环境中,AMAVA 生成语音场景描述以实现态势感知。在频繁移动的情况下,它会通过提供声音提示(例如语音危险警报和环境声音效果)来优先考虑安全。这些音频输出由仅解码器基于 Transformer 的视觉语言模型产生,该模型具有专家混合和跨模式注意力以实现视觉理解,并结合神经文本到语音和自然声音合成网络。所提出的框架使用基于提示的缓存和特定于类别的限制来避免听觉混乱并最大限度地减少延迟。我们对该系统进行了全面评估,包括将单独的白手杖与 AMAVA 进行比较的实时导航研究,结果显示用户信心和感知安全性显着提高。