论文

OpenGlass:用于本地 MLLM 驱动的实时视觉辅助的传感计算分离架构

OpenGlass: A Sensing-Computing Split Architecture for Local MLLM-Driven Real-Time Visual Assistance

AI 基础设施模型部署

摘要

我们推出 OpenGlass,这是一种开源、注重隐私、本地优先的低延迟多模式视觉辅助系统,主要关注盲人和弱视用户。云 MLLM 助手提供强大的视觉理解能力,但通常需要上传第一人称视觉数据,并且可能会遭受数秒的网络延迟;可穿戴眼镜非常适合传感,但在计算和功耗预算紧张的情况下无法承载大型模型。 OpenGlass 通过传感-计算分离来解决这一差距:基于 ESP32 的眼镜端单元捕获视觉上下文,而附近的消费级设备执行本地 MLLM 推理和本地语音输出,减少对云的依赖,并默认将原始的以自我为中心的视觉数据保留在用户控制的设备上。我们评估响应质量、查询就绪音频延迟、安全意识弃权和可审核日志。在真实的 ESP32 Wi-Fi 捕获下,OpenGlass 在调整有效负载大小的情况下达到 993 毫秒的用户音频延迟中值,在原始 1280 x 720 有效负载的情况下达到 1625 毫秒; 97.5% 和 93.3% 的试验分别低于 2 秒。 OpenGlass 是一个用户启动的视觉辅助参考平台,用于障碍物/危险意识、标志/物体查询和图像质量自检,而不是经过认证的导航辅助设备。我们发布源代码、硬件说明、提示、评估数据和日志。