论文

专注于重要的地方:用于低视力辅助的显着性驱动的视觉语言模型

Focus Where It Counts: A Salience-Driven Vision-Language Model for Low Vision Assistance

应用与实践行业应用

摘要

视觉语言模型 (VLM) 正在迅速发展,并为支持失明或弱视人士的辅助技术提供了有前景的功能。然而,现有的 VLM 主要是为通用字幕而设计的,并没有明确地模拟人类感知优先级,从而限制了它们强调场景中最相关信息的能力。为了解决这一差距,我们提出了一个显着性驱动的字幕框架,该框架根据场景元素对以人为中心的援助的重要性来确定其优先级。我们策划了三个显着性感知数据集,即 Salience COCO、Salience Flickr 和 Salience VizWiz,其对象级显着性注释旨在反映与不同环境中的低视力用户最相关的视觉信息。在这些数据集的基础上,我们引入了 Salience-LLaVA,这是一种显着性感知 VLM,它结合显着性线索来生成标题,其中按重要性顺序提及重要元素。我们的工作有四个主要贡献。我们构建了由低视力参与者验证的显着性感知数据集,提出 Salience-LLaVA 来按重要性顺序描述对象,引入 SCMI 来评估排序准确性,并将系统部署在辅助眼镜上以展示现实世界的实用性。代码和数据集可在以下位置获取:https://github.com/topo-focus/Topofocus