论文
在以自我为中心的视觉理解中实现具有双重正确预测的低延迟视觉语言模型
Toward Low-Latency Vision-Language Models with Doubly-Correct Predictions in Egocentric Visual Understanding
摘要
视觉语言模型 (VLM) 在以自我为中心的视觉理解中的迅速崛起,使得人机协作 (HRC) 任务中的低延迟推理变得越来越重要。为 VLM 开发的权重修剪技术可缩小模型大小和计算量,可以轻松应用以满足机载处理和实时交互式机器人的效率要求。此外,安全的人机交互需要保留双重正确预测的修剪策略;输出必须准确且有证据支持,以降低风险并确保用户信任。在本文中,我们通过双重正确预测的视角提出了 VLM 剪枝的新研究。我们的实验令人惊讶地表明,现有的修剪方法通常会保留正确的证据定位,但会破坏正确的预测。为了解决这个问题,我们提出了一种基于合理性的修剪策略,可以更好地将证据与决策结合起来。以自我为中心的视频数据集的基准结果表明,我们的方法不仅实现了最高的预测精度,而且在实现双重正确预测方面优于现有方法。我们的目标是促进对高效、可靠的 VLM 的研究,确保准确性驱动的进步与负责任的人机交互和体现智能所需的透明度、可审计性和安全性相一致。