论文
MoTE:多任务视频理解的任务专家组合
MoTE: Mixture of Task Experts for Multi-Task Video Understanding
摘要
过程视频语言模型必须从相同的视觉证据中解决异构任务,包括动作识别、预测和过程预测。密集的 Transformer 解码器跨任务共享相同的前馈网络,这可能会纠缠任务行为并使受控能力扩展变得困难。稀疏专家混合 (MoE) 解码器提供条件计算,但 词元级 学习路由并不自然地与任务级程序目标保持一致。我们提出了 MoTE(任务专家混合),这是一种解码器架构,可将 大语言模型 前馈网络转换为特定于任务的专家,同时保持多模式主干共享。每个示例都遵循一个样本级任务路线,因此活动的任务专家计算保持独立于存储的任务专家的数量。我们将此设计实例化为 VideoLLM-MoTE,并使用显式任务路径在五个 COIN 基准上对其进行评估。五位专家模型激活每个样本约 2B LLM 参数,并实现比最近的 VideoLLM 基线更高的平均 top-1 准确度。在相同的专家拓扑下,它改进了密集的全专家激活和学习的稀疏路由控制。这些结果表明,任务结构路由为多任务视频语言学习提供了一种可解释且计算高效的解码器替代方案。