论文
EgoSIS:从分解的视觉自运动变化到运动规范化空间证据的无人机推理
EgoSIS: From Factorized Visual Ego-Transitions to Motion-Canonical Spatial Evidence for UAV Reasoning
摘要
无人机视频问答需要将摄像机运动与场景变化分开,但纯 RGB 多模态模型没有收到用于该分离的明确、稳定的参考。我们推出了 EgoSIS,一种无姿势适配器,可分三个阶段将 RGB 衍生的双向流转换为运动规范视觉证据。因子化视觉自我转换 (FVET) 适合稳健的图像平面转换,并揭示运动、残余支撑和可靠性因素。可靠性门控自我转移记忆(ReTEM)对有限的历史使用可靠性加权更新,并在削减或持续的不确定性时重新锚定它。自我对齐空间证据 (EASE) 将支持的视觉特征扭曲到每个片段的本地锚中,并通过零初始化残差为每个视觉切片注入四个空间证据标记,而不改变 Qwen 的视觉标记计数。在 SIS-Bench 上,EgoSIS-8B 获得了 89.9% 的感知、82.5% 的感知加记忆和 76.2% 的整体准确率,其中最大的增益集中在自我意识感知和记忆上。因此,适配器提供了光流和空间推理之间的可解释接口。