论文

ViSAGE:为长视频理解构建自校正记忆

ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding

上下文与知识记忆Agent记忆

摘要

多模态代理在长时态环境中必须构建和持续更新多媒体记忆,以支持与实体一致、时间地锚定的推理。然而,现有的代理记忆方法通常在激烈的压缩和段式处理下丢弃细粒度的身份线索。它们还依赖于向量相似性检索,这可能导致表面相似但身份不符的证据,从而导致实体混淆、错误传播和幻觉答案。我们提出ViSAGE,这是一种多模态代理记忆框架,它通过跨模态绑定在长时间范围内锚定实体身份,然后应用双向记忆精炼来传播延迟的身份证据,从而反向统一历史记录并提高未来推理。我们还引入了多代理交叉验证,以在身份证据约束下评估检索到的证据,从而允许放弃而不是不支持答案,当证据缺失时。广泛的实验结果表明,ViSAGE始终优于最强的基准,准确率高出5.9%。

ViSAGE:为长视频理解构建自校正记忆:论文配图
图 1. 使用 ViSAGE 进行卓越的长期推理。在复杂的长视频中,标准记忆会与延迟的身份和视听错位作斗争。 ViSAGE 有效地解决了这些歧义。通过在时间线上建立一致的实体跟踪,它绕过了误导性噪音,并为复杂的时间查询提供了精确、无幻觉的答案。我们的方法通过提取和对齐碎片多模态线索来处理原始视频——使用 A(·) 进行音频分析,F(·) 进行面部检测,L(·) 进行基于 LLM 的外观(外观)分析——按时间顺序排列。通过双向内存细化,它将匿名实体解析为统一身份(例如,Alice),构建顺序事件日志和配置文件更新对象卡的双轨内存。在查询解析期间,认知裁决采用角色驱动的多代理交叉验证。代理从记忆层检索证据,以确保响应有事实依据且身份一致,从而在代理缺乏相关上下文时能够验证拒绝。