论文
ViSAGE:为长视频理解构建自校正记忆
ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding
摘要
多模态代理在长时态环境中必须构建和持续更新多媒体记忆,以支持与实体一致、时间地锚定的推理。然而,现有的代理记忆方法通常在激烈的压缩和段式处理下丢弃细粒度的身份线索。它们还依赖于向量相似性检索,这可能导致表面相似但身份不符的证据,从而导致实体混淆、错误传播和幻觉答案。我们提出ViSAGE,这是一种多模态代理记忆框架,它通过跨模态绑定在长时间范围内锚定实体身份,然后应用双向记忆精炼来传播延迟的身份证据,从而反向统一历史记录并提高未来推理。我们还引入了多代理交叉验证,以在身份证据约束下评估检索到的证据,从而允许放弃而不是不支持答案,当证据缺失时。广泛的实验结果表明,ViSAGE始终优于最强的基准,准确率高出5.9%。
