论文
SeMARC:在基础模态编码前选择采集与停止
Efficient Multimodal Inference through Adaptive Acquisition and Sequential Fusion
摘要
多模态系统通常对每个可用输入进行编码,即使一个子集足以进行预测也是如此。自适应采集可以通过使用增量融合证据的预测来决定下一步编码哪种模式以及何时停止,从而降低这种成本。然而,顺序融合使这些预测依赖于顺序,因此基于它们的决策可能需要对同一已采集集合的多个历史进行阶乘区分。我们引入了 SemARC,它将顺序模态聚合器 (SeMA) 与自适应运行时控制器 (ARC) 结合起来,并在编码器运行之前使用获取的证据来选择每种模态。 SeMA 仅执行选定的编码器和融合分支,更新固定大小的状态,并在每次采集后进行预测,而无需重新计算早期分支。我们在随机模态子集和顺序下监督每个采集前缀,以鼓励跨采集订单的一致预测。 ARC 将依赖于集合的边际效用先验与残差拟合 Q 学习相结合,以选择下一个可用的模态或停止,而不检查未获取的输入或保留获取顺序。在 6 个多模态分类数据集和 11 个基线中,相对于每个数据集最准确的基线,SemARC 的macro-F1 平均提高了 3.2%,总推理 GFLOP 降低了 61.4%。相对于最快的测量基准,端到端延迟在 GPU 和 CPU 上平均下降了 44.0%,在 Android INT8 上下降了 47.2%。在不同的运行时模态缺失情况下,SemARC 仍然会跳过可用的模态,在 24 种条件中的 21 种中匹配或超过最佳基线宏 F1,总 GFLOP 平均降低 14.8%。因此,SemARC 提供了一条跨异构设备进行高效多模态推理的实用途径。
