论文

ICM-Bench:具有长期记忆的多模式代理中的人级身份推理

ICM-Bench: Person-Level Identity Reasoning in Multimodal Agents with Long-Term Memory

模型评测基准与评测资源

摘要

长视野多式联运代理不仅应该记住发生的事情,还应该记住谁参与了。这种能力依赖于将重复出现的面孔、声音、名字、与人相关的物体、事件和社会关系与随着时间的推移保持一致的身份联系起来。现有的长视频和多模态代理基准测试了广泛的记忆问题回答能力,但它们并没有隔离在跨时间关系中维持重复的个人身份和推理的能力。我们推出了 ICM-Bench(以身份为中心的内存基准),据我们所知,这是第一个专门设计用于评估多模式代理中长视频内存的以身份为中心的推理的基准。该基准测试包含 839 个长达 141 分钟的合成剪辑和 1,217 个开放式问题,涉及一年生活专辑中的六个经常出现的成年人。可配置主题的管道生成视频集合,并将每个问题与其目标身份和可追踪的支持证据相关联。我们比较了直接字幕记忆基线、记忆增强代理和图形检索系统。 Gemini 3.1 Pro 的总体准确率最高为 74.0%,但在需要长期身份资料的问题上,其得分下降至 60.3%。结果表明,当前的系统可以恢复许多事件级记忆,但当必须在稳定的人周围积累证据时,可靠性仍然较低。