论文

教师和求解器代理之间的视频问答反思对话

Reflective Dialogue between Teacher and Solver Agents for Video Question Answering

上下文与知识上下文工程

摘要

人们提出了各种方法来使视觉语言模型(VLM)适应视频问答的专门领域,包括 微调 和上下文学习。然而,在推理阶段仅从没有 微调 的小型标记支持集获取特定于任务的知识仍然是一个挑战。在本文中,我们提出了一种仅通过推理时上下文注入来实现自适应的方法。我们的方法首先构建一个反思性对话(RD)——两个代理之间的多轮对话,其中教师提出每个支持问题并提供正确性反馈,求解器回答并为正确和错误答案提供视觉基础解释(或反思)。然后,该对话历史将用作推理阶段的上下文。 EgoCross 基准测试表明,我们的方法优于基线零样本设置和直接传递支持集示例的标准上下文学习方法,在 CVPR 2026 EgoVis 研讨会上第一届跨域 EgoCross 挑战赛的开源赛道中获得第三名,本文也作为该研讨会的技术报告。