论文

您所需要的就是正确的推理策略:用于 EgoCross 挑战的近 无需训练 领域推理

The Right Inference Strategy Is All You Need: Nearly Training-Free Domain-Wise Inference for EgoCross Challenge

上下文与知识上下文工程

摘要

EgoCross 在实质性领域转移下评估多模态 大语言模型 以自我为中心的视频问答,其中测试视频来自手术、工业装配、极限运动和动物安装摄像机,而不是普通的日常生活场景。在源限制赛道中,基础模型固定为Qwen3-VL-4B,而官方特定任务支持集仅包含20个训练样本。此设置减少了模型缩放方面的挑战,而更多地涉及向受限模型暴露正确的视觉、时间和答案选择线索。我们的主要观察结果是,冻结的基线模型不仅无法应对这些罕见的情况,而且还无法解决这些问题。相反,如果没有适当的界面,它通常无法将现有的视觉语言知识转移到新的任务格式。因此,我们使用领域推理策略,分别处理四个目标领域,并根据每个领域的任务特征设计不同的输入、提示和答案映射程序。这些策略通过强调对每个领域重要的线索,使罕见的以自我为中心的场景更容易被 VLM 解释。由此产生的系统几乎是 无需训练:手术和动物问题都通过基本 Qwen3-VL-4B 模型来回答,而 XSports 和行业仅使用在提供的 20 个训练样本上训练了两个时期的官方 SFT 检查点。在最终评估中,这个简单的策略达到了 66.98% 的总体准确率,这表明仔细的领域感知推理可以弥补有限的基础模型强度,并恢复基线模型中已经存在的大部分能力。