个人记忆 RAG 的 LINE 对话历史检索:评估搜索表示和混合检索
LINE Conversation History Retrieval for Personal Memory RAG: Evaluating Search Representations and Hybrid Retrieval
摘要
作为 大语言模型 (LLM) 个人记忆检索增强生成 (RAG) 的第一步,本研究提出了针对一个用户的 LINE 对话历史记录的仅检索案例研究。我们将 358,896 条消息分割成 22,329 个时间连贯的块,并构建了三种搜索表示:raw_text(生成的摘要)和 embedding_text(将摘要与原始文本摘录和其他固定文本相结合)。我们在由单个注释者验证的 100 个评估问题上比较了 BM25、密集向量检索和线性混合检索。在个体 检索器 中,embedding_text_bm25 达到了最高点估计,Recall@5 为 0.584。然后,我们针对同一评估集上的 126 种配置探索了 6 个 检索器 配对和 21 个权重。在 beta = 0.45 时选择的 embedding_text_bm25 和 embedding_text_vector 组合实现了 Recall@5 = 0.697、MRR@5 = 0.595 和 nDCG@5 = 0.575。其 Recall@5 超出 embedding_text_bm25 0.113,问题级配对百分位数引导 95% 置信区间为 [0.048, 0.184]。此间隔以固定在相同 100 个问题中选择的配置为条件,并且不考虑配置选择或权重搜索的不确定性。 beta = 0.50 时与基于摘要的混合的差异为 0.050,95% 置信区间为 [-0.013, 0.115],因此无法建立明显的差异。与其他问题类型相比,这 17 个聚合问题的点估计值也较低,这表明当证据分布在多个时间和对话中时,平面块级检索会遇到困难。该评估是一项探索性单用户、单注释者研究,针对用于配置搜索的同一问题集进行;它不评估最终答案的生成或对未见过的问题的概括。