论文

更少的视觉标记何时可以加速多模态推理?跨决策位置和硬件的收支平衡研究

When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware

模型评测评测方法与指标

摘要

视觉词元更少并不保证端到端延迟更低。本文以可复现协议分析压缩何时能抵消额外开销,计入决策成本、共享计算和各策略可省略的算子,再通过阶段级分解与实测延迟核对。在30个样本的试验中,两种自回归探测方法即使复用状态,也仍慢于完整输入基线Full。轻量的视觉编码后预测器在RTX 3090和A100上均降低延迟,配对置信区间低于零,并在保守的全配对Holm校正后保持显著。视觉编码前的图像尺寸规则在两款GPU上也得到低于零的区间,但经过同一校正后不再显著。视觉编码前路由可以跳过预处理和视觉编码,这是编码后剪枝没有的结构优势;在A100上,这一优势超过编码后策略近八倍的下游词元削减收益。所报告的质量仅针对Full能够正确回答的样本,不是完整基准准确率。