论文

vstash:LLM 代理的本地优先混合检索与自适应融合

vstash: Local-First Hybrid Retrieval with Adaptive Fusion for LLM Agents

上下文与知识检索增强

摘要

我们提出了 **vstash**,这是一种本地优先的文档存储系统,它通过倒数秩融合 (RRF) 和自适应每个查询 IDF 加权将向量相似性搜索与全文关键字匹配相结合。所有数据都驻留在单个 SQLite 文件中,使用 sqlite-vec 进行近似最近邻搜索,并使用 FTS5 进行关键字匹配。我们做出了四项主要贡献。 **(1)** 通过混合检索不一致进行自监督嵌入细化:在 SciFact、NFCorpus 和 FiQA 上的 753 个 BEIR 查询中,74.5% 在向量重 (vec=0.95, fts=0.05) 和 FTS 重 (vec=0.05, fts=0.95) 搜索(每个数据集速率)之间产生前 10 名不一致63.4% / 73.4% / 86.7%,第 5.2 节),提供无人工标签的免费训练信号。 微调 BGE-small(33M 参数)在 76K 不一致三元组上具有 MultipleNegativesRankingLoss,改进了所有 5 个 BEIR 数据集上的 NDCG@10(与 BGE-small 基本 RRF 相比,NFCorpus 上高达 +19.5%,表 6)。在 5 个数据集中的 3 个上,在不同的预处理下,调整后的 33M 参数管道匹配或超过已发布的 ColBERTv2 结果(110M 参数)和未经训练的 BGE 基础(110M);在 FiQA 和 ArguAna 上,它的表现低于 ColBERTv2(第 5.5 节)。 **(2)** 具有每个查询 IDF 权重的自适应 RRF 与固定权重相比,在所有 5 个 BEIR 数据集上改进了 NDCG@10(在 ArguAna 上高达 +21.4%),在具有 BGE-small 的 SciFact 上实现了 0.7263。 **(3)** RRF 后评分的负面结果:频率+衰减、历史增强召回和跨编码器重新排名都未能改善 NDCG。 **(4)** 生产级基质,具有完整性检查、模式版本控制、排名诊断和基于距离的相关性信号,并在 5 个 BEIR 数据集的 50,425 个相关性判断查询上进行验证。在具有稳定 NDCG 的 50K 块下,搜索延迟中值仍为 20.9 毫秒。微调后的模型在 HuggingFace 上发布为“Stffens/bge-small-rrf-v2”。所有代码、数据和实验都是开源的。