论文

OmniEgo-R$^2$:CVPR 2026 上第一届跨域 EgoCross 挑战赛的路由推理框架

OmniEgo-R$^2$: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026

模型推理推理策略与问题分解

摘要

EgoVis 的第一届跨域 EgoCross 挑战赛,CVPR 2026 评估多模态 大语言模型 是否可以对跨手术、工业、极限运动和动物视角的以自我为中心的视频进行推理。我们在源代码限制和开源赛道上都获得了第二名。在这份报告中,我们将 EgoCross 表述为一个鲁棒的跨域体现视频推理问题,而不是一个简单的多项选择视觉问答任务。我们确定了三个关键挑战:(C1)时间边界模糊性,其中关键状态转换是稀疏采样的并且经常发生在帧之间; (C2)跨域语义粒度不匹配,其中相同的能力需要不同的特定域视觉语法; (C3) 紧密选项下的决策不稳定,其中长多模态推理可能会选择不受支持的干扰项或产生格式错误的输出。为了解决这些问题,我们提出了 OmniEgo-R$^2$(Omnidomain Egocentric Routed Reasoning),这是一个统一的路由推理管道,包括时间证据归一化、领域不可知的能力路由、结构化感知-动态-决策推理、边界感知选项验证和防御性答案校准。 OmniEgo-R$^2$ 使用每个 EgoCross 域上的 Qwen3-VL-4B-SFT 检查点作为视觉语言主干,并用轻量级测试时推理和解析程序包装它们。我们最终提交的作品在 Source-Limited 赛道上获得了 66.35% 的总体准确率,在 Open-Source 赛道上获得了 66.77% 的总体准确率,在两个排行榜上均排名第二。代码可在 https://github.com/Lee-zixu/OmniEgo-R2 上获取