论文
Visual Jev:通过共享视觉上下文做出准确高效的决策
Visual Jev: Accurate and Efficient Decisions from Shared Visual Context
摘要
许多视觉应用程序都会针对同一图像提出几个独立的强制选择问题。 Visual Jev 对图像和公共上下文进行一次编码,批量执行孤立的问题后缀,并从主干的语言模型头部读取候选概率。在四个基准中,答案监督的训练后将等权重宏观准确率从 70.6% 提高到 76.1%,收益集中在训练中代表的两个任务系列上。在每张图像 N=32 个问题的情况下,共享批处理执行在热摊销时间内比独立串行执行快 8.9 倍,并且比重新计算前缀的已批处理基线快 3.4 倍,但代价是更高的峰值内存。与语言模型头读数相比,匹配的打字头控制没有提供一致的准确性优势。因此,支持的设计很简单:调整主干以提高质量,保留现有的读数,并共享执行以提高效率。