论文
小而辅助:低视力空间感知后训练
Small yet Assistive: Spatially-Aware Post-Training for Low Vision
摘要
据估计,全球有 10 亿人患有视力障碍,但当前的视觉语言模型 (VLM) 生成的描述过于模糊,无法让盲人和低视力 (BLV) 用户安全导航。大型 VLM 可以生成高质量的符合音频描述的旁白,但无法在移动设备上运行;小型 VLM 提供有竞争力的延迟,但缺乏空间细节、方向提示和导航辅助的危险意识。我们提出了 Smol-VL-BLV,这是一种针对盲人和低视力用户的紧凑型 VLM,它使用 500M 解码器Transformer模型和两种后训练机制来缩小这一差距:(1)师生蒸馏和(2)组相对策略优化(GRPO),具有针对定向语言、度量距离和危险检测的复合 BLV 奖励。由于多阶段后训练可能会导致灾难性遗忘,因此我们在最后阶段 GRPO 微调之后添加了一个轻量级微调阶段,以恢复一般描述质量,同时保留 BLV 特定的空间基础。我们的最佳模型在各种基准测试中显着优于基准,包括任务:VQA、BLV 字幕、OCR 和延迟。与相对改善的基线相比,空间得分提高了 19.3%,社交得分提高了 14.8%。它还将 OCR-Bench 提高了 101.5%,并将 TextVQA 准确率提高了 44.2%。这些结果表明,以 BLV 为中心的后期训练可以改善特定于可访问性的空间基础和一般的视觉文本推理。该模型通过混合精度量化部署在中端 Android 智能手机上,仍保持约。 450 MB,完全在设备上离线运行且不依赖于网络,生成的描述的延迟取决于主机硬件功能。我们的模型、数据集和代码在此 https URL 公开发布