论文

良好的记忆力具有 ECC:评估视觉语言模型的记忆超越准确性

Good Memory Has ECC: Evaluating the Memory of Vision-Language Models Beyond Accuracy

模型评测评测方法与指标

摘要

内存被广泛视为 LLM 和 VLM 的一个重要的未解决问题,当前的基准测试通常通过测试长文本或视频的准确性来评估内存。然而,仅靠准确性就忽略了对真正的长期任务重要的属性。我们引入了 ECCBench,这是一种基准测试和评估协议,它通过我们称为 ECC 的三个轴测量超出系统容量的内存(特定预算下的原始精度): 效率 - 从内存中回答所需的计算(以 FLOP 为单位);压缩——可压缩输入是否被更准确或更有效地记住;和校准——系统是否因自身的不确定性和错误成本而放弃。我们发现预训练的 VLM 在文本上压缩其内存,但在视频上却没有,而且两者的校准都很差。在更广泛的内存主干中,一些非 Transformer 架构比 RoPE Transformer 实现了更好的压缩校准权衡,这表明它们可能是长期运行的代理的有用组件。