论文

参数化多模式用户内存:存储字幕不能携带的内容

Parametric Multimodal User Memory: Storing What Captions Cannot Carry

上下文与知识记忆Agent记忆

摘要

个性化代理需要用户记忆:用户是谁的持久模型。如今,它几乎总是文本——通过相似性检索的文字记录和说明文字。这服务于一个人的可描述的一半(“我的猫叫比比”),但丢弃了任何描述都无法容纳的感性一半:声音听起来如何,一张脸如何在年龄和光线下解读,一个人听起来有多累。我们通过五种方式测量这种损失:一个强大的基于标题的重识别器仅恢复了专用编码器召回率的 0.11,在不可命名信号上崩溃了。相反,我们将感知记忆融入模型中,将回忆分解为两个子问题:视觉语言模型将所指对象置于上下文中(什么和哪里),专用编码器提取身份密钥(谁),存储为一个内联标记,由注意在生成时读取,无需外部往返。单独使用两者都不够——VLM 仅以 0.54 的召回率识别跨年龄的面部,而面部编码器达到 0.81,而未接地编码器以 0.05 的召回率识别两人场景所指对象——但它们一起达到正确区域预言 (0.96),推广到多说话人音频和视频。识别核心是 无需训练:它以 O(1) 注册成本在任何冻结模型上重现编码器的召回。在 PerceptMem(12 个域,1,080 个任务)上,感知身份是容量有限的,而确切事实是绑定限制的:身份属于参数库,事实属于文本存储。这两种记忆清晰地组合在一起:具有这两种记忆的智能体不仅可以记住用户所说的话,还可以记住他们的样子。