论文

视频LLM输出时间应该如何?高效时序定位范式分析

How Should Video LLMs Output Time? An Analysis of Efficient Temporal Grounding Paradigms

模型评测模型能力评测

摘要

虽然多模态 大语言模型 (MLLM) 具有先进的视频时序定位 (VTG),但现有方法通常将输出范例与不同的主干网、数据集和训练协议结合起来。这使得隔离输出设计的具体影响变得具有挑战性。此外,随着 VTG 系统越来越多地被考虑用于资源受限的边缘部署,输出公式和系统级效率之间的权衡需要进行系统研究。在本文中,我们提出了一项受控实证研究,比较了三种主要的 VTG 输出范式:文本数字生成、时间标记生成和连续时间解码。我们使用一致的数据集和 LoRA 微调 协议在相同的紧凑型 VLM(SmolVLM2、FastVLM 和 Molmo2)中评估这些范例。对 Charades-STA、QVHighlights 和 YouCook2 的评估可衡量定位精度和系统效率,包括推理延迟、训练吞吐量和参数开销。我们的结果表明,输出公式的选择会显着影响时序定位精度和计算成本,与模型规模无关。具体来说,连续分布范例始终在帕累托前沿上实现最有利的效率与准确性权衡,以最小的延迟开销提供强大的定位。这些发现为设计高效、可部署的 VTG 系统提供了客观的经验指南。