论文
Tablet 2:无需词汇匹配的多语言、多模态记忆检索评测
Wontopos Tablet 2: Measuring Multilingual and Multimodal Memory Retrieval Without Lexical Matching
摘要
研究在常用文本记忆基准及无文字照片的跨语言检索中评估生产级长期记忆引擎tablet-2。检索不含词汇匹配、关键词评分,也不使用自身语言模型。LongMemEval-S的500题得分95.7%,区间93.4%–97.1%;BEAM-1M的700题、221万条记忆得分67.5%,区间64.8%–70.2%。区间反映问题抽样波动,而非更窄的重复运行波动。研究重点说明仅看这些分数的局限:固定引擎、语料、配置和评判,更换回答模型可使LongMemEval-S变化2.0个百分点,更换重复提问预算可使BEAM-1M变化8.9个百分点。所比报告未披露这些设置,后者影响超过多数系统差距,因此表格只作比较参照而非严格排名。多模态评测中,70个存储与查询语言组合的平均Recall@5为95.2%,BM25为19.0%,并在54个组合中为零;无文字照片也没有供词法检索评分的文档。14种语言、300张Crossmodal-3600照片的开放稠密检索基线显示,稠密表示本身不保证语言无关:同一图像向量下某基线英语91.0%、俄语4.7%,多语言版本在泰卢固语和斯瓦希里语上也明显失效。tablet-2的跨语言差距14.0个百分点,对照为27.5和27.7。研究同等报告三个负面结果:斯瓦希里语仅53.0%、泰卢固语64.0%;附加图像描述使跨语言检索下降11.4个百分点;自身某一检索阶段漏掉一项设置,使韩语top-1准确率下降37个百分点,而另九种语言不变。