论文
PixelTriage:读取前选择值得完整像素的记忆
Decide Before You Look: Learning Which Retrieved Memories Deserve Pixels
摘要
多模式助手回答来自包含图像的长期记忆的问题。检索后,每个检索到的图像要么作为像素(每张图像大约有 1000 个视觉 token)到达回答模型,要么作为存储的文本代理,但通常会错过问题所询问的细节。我们发现像素的好处通常来自一两个检索到的记忆,并且可以在回答模型运行之前进行预测,而无需读取任何全分辨率图像。在 PixelTriage(检索后放置的插件)中,一个不生成文本的小模型读取每个检索到的记忆的对话、简短注释和缩略图,并预测其像素会增加多少。它在由冻结的 27B 模型标记的合成记忆片段上进行训练,该模型回答带有或不带有每个记忆像素的每个问题。凭借 7B 回答模型,PixelTriage 位于 M$^3$Exam、DMV 和 MemEye 的准确性成本前沿,并使用视觉 token 的 11--23%,而不会显着损失准确性。在 DMV 上,它的响应速度比打开所有图像快 2.9 倍。在同等预算下,它的性能优于检索顺序和统一缩小规模,并可转移到其他记忆系统和 397B 应答模型。