论文
FastJEV:了解紧凑型 JEV 推理的冗余
FastJEV: Understanding Redundancy for Compact JEV Inference
摘要
JEV 模型通过直接对候选人进行评分来做出多模式决策。尽管公共上下文被编码一次,但候选评估仍然可以重复匹配token历史、复制推理状态并执行完整的主干。在本文中,我们研究了这些冗余来源,并提出了用于紧凑候选评估的 FastJEV。我们共同组织历史重用和状态存储,因为共享计算需要为后续分支保留状态。我们首先引入共享上下文锚定以重用循环初始状态并省略未使用的最终循环缓存。我们通过候选前缀共享来扩展这种重用,保留后续分支所需的中间状态。为了进一步减少这些路径的深度,我们根据在小型未标记集上测量的相对分数变化来应用决策引导修剪。我们的方法保留了完整的上下文编码和所有候选者,无需额外的培训。我们在五个公共基准上评估了三个 OmniJev 模型大小的 FastJEV,并重建了 LIBERO-10 离线问题。在选定的修剪预算下, 完整的方法将候选深度减少了 43.75% 至 45.83%,同时在六个评估集上平均保留了原始任务分数的 93.66% 至 97.52%。通过受控实验,我们展示了候选重叠和分支结构如何影响历史重用的执行成本。在我们的实现中,候选前缀共享可以减少重复计算,同时增加延迟。这些发现激励设计共享粒度和执行计划,以实现高效的 JEV 推理。