论文
R4DSG:相对 4D 场景图形内存,用于长自我中心视频中以对象为中心的问答
R4DSG: Relative 4D Scene Graph Memory for Object-Centric Question Answering in Long Egocentric Video
摘要
长视野的以自我为中心的视频是可穿戴人工智能助手的丰富基础,但以对象为中心的问题,例如项目被移动到哪里、最后一次改变状态是什么时候,或者为什么被重新定位,仍然很困难,因为基于字幕和转录的记忆很少保留持久的对象身份或结构化空间变化。现有的长视频 QA 方法主要强调时间基础和剪辑检索,而先前的 3D 场景图方法通常假设比自由运动可穿戴 RGB 视频提供更强的几何形状,包括点云、RGB-D 输入、姿势视图、稀疏重建或重建场景。 R4DSG 为长的以自我为中心的视频引入了相对 4D 场景图形存储器。 R4DSG 不是存储原始图形序列,而是将视频转换为按时间、地点、持久对象、锚点相对变化和本地交互上下文索引的紧凑可查询内存条目。主要思想是将稳定锚点与动态对象分开,跨帧维护持久对象身份,并通过锚点相对转换而不是全局对齐的世界模型来表示对象状态。该方法基于最新的仅 RGB 在快速视频分割、时间传播和相对 3D 提升方面的进展,生成可直接用于长视野问答的检索就绪存储器。对来自 EgoLifeQA 的 255 个与对象相关的问题子集的评估显示,在仅问题检索下,比 EgoRAG-Text 总体提高了 6.7 分,在何时问题上提高了 12.5 分,这凸显了按时间组织的对象记忆的价值。这些结果将相对 4D 场景图定位为可穿戴助手、AR 系统和嵌入式多媒体代理的实用存储基底。 GitHub 页面:https://dualtransparency.github.io/R4DSG/。