论文

CVPR 2026 CASTLE 挑战赛第三名:通过分层知识图检索进行代理多视图长上下文视频理解

3rd Place at CVPR 2026 CASTLE Challenge: Agentic Multi-View Long-Context Video Understanding via Hierarchical Knowledge Graph Retrieval

上下文与知识知识图谱

摘要

本文介绍了我们在 CVPR 2026 EgoVis 研讨会上 CASTLE 2026 挑战赛的获胜方法,我们的团队在该研讨会上获得了全球第三名。该挑战要求参与者在大量多模态视频流中回答高度复杂的视觉、时空和语言问题,包括视觉计数、动作定位、多视图跟踪和说话者时间推理。底层数据集由 15 个 ego 和 exo 摄像机源捕获的 600 多个小时的同步镜头组成。为了解决这种环境的极端规模和长上下文需求,我们引入了针对长格式视频理解而优化的 无需训练 代理框架。我们的框架引入了两个核心架构组件:i)视频知识图,它映射静态和动态实体、它们的时间关系和交叉事件以实现多跳关系推理;ii)自适应代理工作流程,通过分层检索和索引解决复杂查询。实证结果表明,我们的框架在长上下文多视图流上实现了较高的零样本推理精度。我们的代码将在 https://github.com/RaghadKhaled/CASTLE-Challenge-Framework 发布。