论文

一种技能并不适用于所有:长视频问答的帧选择技能的自动发现和分类引导路由

One Skill Does Not Fit All: Automatic Discovery and Taxonomy-Guided Routing of Frame-Selection Skills for Long-Video Question Answering

上下文与知识上下文工程

摘要

长视频问答(LVQA)需要在有限的帧预算下在小时尺度的视频中找到决定性的证据。尽管不同问题类型所需的证据存在很大差异,但大多数免训练方法对所有问题都采用相同的框架选择策略。我们的分析表明,框架选择策略的相对有效性因语义类别和基准的不同而不同,从而激发了适应性证据获取。在本文中,我们介绍了 AutoSkill,这是一个源监督框架,用于自动发现和路由可执行的帧选择技能。从一个小的标记源池开始,LLM 代理迭代地提出、实施、评估和完善候选人的技能。对于目标基准,AutoSkill 仅使用未标记的问题和选项文本来引入共享语义分类,将标记的源示例重写为目标样式,并估计类别到技能的映射。在此过程中既不使用目标视频,也不使用目标答案。在推理时,每个问题都分配有一项技能,该技能选择在冻结视频 MLLM 的单个推理中使用的帧。在五个长视频基准测试中,AutoSkill 将 Qwen2.5-VL-7B 和 Qwen3.5-4B 分别提高了 2.4% 和 1.2%,这证明了我们 AutoSkill 的有效性。