论文

EgoGazeLite:设备上以自我为中心的注视预测,用于词元高效的多模式 LLM 视频输入

EgoGazeLite: On-Device Egocentric Gaze Prediction for Token-Efficient Multimodal LLM Video Input

上下文与知识上下文工程

摘要

使用多模态 LLM (MLLM) 通过可穿戴设备进行以自我为中心的视频理解受到 词元预算 的限制。内存和计算成本随着视觉标记的数量而增加,而高分辨率视频的大规模传输和处理很快就会变得昂贵。之前的工作(GazeLLM)通过裁剪相机佩戴者视线周围的视频来解决这个问题。这将视觉标记的数量减少了大约十倍,同时保持或提高了全分辨率描述的质量。然而,这种压缩策略依赖于专用的眼动追踪硬件,而消费类智能眼镜不具备这种硬件。构建纯软件替代品会带来共同的限制:预测器必须足够准确,以保持下游描述质量,但又必须足够轻,能够在智能手机的功耗和计算预算范围内在设备上运行。我们通过 EgoGazeLite 解决了这个问题,这是一种用于以自我为中心的视频的轻量级双进程注视预测器。在两个 MLLM、三个自动指标和两个 LLM 法官中,预测注视作物与 真值 凝视作物没有显着差异。在所有十个案例中均证实了等效性。 EgoGazeLite 以 1570 万个参数、6.71 GFLOP 的速度实现了这一目标,并在消费者加速器硬件上实时端到端地运行完整的凝视和裁剪管道(21.6 毫秒/帧)。总之,这些结果消除了对眼动追踪硬件的需求,通过 MLLM 实现高效、以注视条件为中心的以自我为中心的视频理解。