论文

回答我的问题需要多少钱?基于云 VLM 的 VQA 系统基准测试

How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems

模型评测基准与评测资源

摘要

视觉语言模型 (VLM) 正在成为移动视觉问答 (VQA) 系统的实用后端,使智能手机和智能眼镜能够回答用户有关物理世界的问题。由于现代 VLM 仍然难以在移动和边缘设备上运行,VQA 系统越来越多地将推理卸载到基于云的 VLM。这使移动设备能够获得更强大的计算能力,但也使视觉输入准备成为关键的系统变量:卸载之前如何准备图像不仅会影响答案质量,还会影响有效负载大小、词元成本和系统延迟。专有 API 几乎无法控制模型内部或服务行为,从而使客户端预处理成为下游开发人员的主要实际优化空间。许多此类技术已被提出用于视觉卸载,但从未研究过它们对商业云 VLM 的成本质量影响。为了填补这一空白,我们推出了 VQABench,这是第一个系统基准测试,它将客户端输入预处理视为基于云 VLM 的 VQA 的受控变量。我们评估了来自三个提供商的三个 VQA 数据集和四个商业 VLM 的 12 种预处理技术,总计 95,168 个 API 调用。我们的结果表明,预处理并不是普遍有益的:其有效性取决于目标模型、API 范式、提供者词元会计规则和任务制定。选择不当的预处理策略可能会增加部署成本或延迟,同时降低答案准确性。总体而言,我们的基准阐明了预处理何时有用、何时失败以及原因,为指导 VQA 系统的未来研究和实际部署提供了见解。