论文
利用视觉语言模型进行增强现实中的感知质量评估和自主内容调整
Harnessing Vision-Language Models for Perceptual Quality Assessment and Autonomous Content Adjustment in Augmented Reality
摘要
增强现实 (AR) 的进步不断催生创新解决方案,促进教育系统、医疗保健服务和风险缓解方案中的新颖方法。然而,优化最终用户的沉浸感和舒适度仍然具有挑战性,因为 AR 头戴式显示器要应对受限的场景几何形状、空间抖动和时间不稳定性。用户研究是视觉质量的标准 AR 评估方法,但其成本、可扩展性下降和不灵活性在迭代应用程序设计过程中构成了瓶颈。为了解决这个问题,我们提出了一个基于视觉语言模型(VLM)的 AR 内容评估和细化自动化框架,以评估和预测用户感知的 AR 场景的视觉保真度。首先,我们介绍 RateAR,这是在不同场景和环境条件下收集的 AR 图像和视频的基准,在感知因素(包括对象放置、比例和阴影一致性)上具有良好到优秀的可靠性 (ICC(2,5) >= .90)。随后,我们根据精心设计的基准评估了 11 个商业 VLM。结果表明,基于 VLM 的质量预测与人类主观判断密切相关,实现了高达 0.8695 的 Spearman 排序相关性。消融研究进一步表明,与其他提示策略相比,我们的情境提示可以更好地与人类评分保持一致,同时平衡引入的复杂性线索。基于这些发现,我们构建了一个自动 AR 内容调整系统,并进行了 21 名参与者的用户研究。超过 90% 的参与者发现该系统改善了虚拟内容的放置和大小一致性。